AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1861-1880 条,共 2269 条
第 94 / 114 页
事件日期 2026-07-14

基于功率谱的可预测性指数不能回答“添加上下文(更长回看窗口、检索插件或预训练模型)是否有帮助”这一问题,因为上下文的价值取决于操作点而非序列本身,且频谱在相位随机化下不变,而超越二阶的高阶结构才是检索和基础模型真正贡献的部分。

该论文提出一项“不可能结果”:任何仅从功率谱构建的指数都在相位随机化下保持不变,而相位随机化序列渐近高斯化,会破坏检索和基础模型所依赖的超越二阶的结构。作者通过构造“频谱和边际相同但相位不同”的替代对(surrogate pairs),隔离出频谱不变性带来的误导。在此基础上,提出一种无需标签的配置级诊断——**覆盖亏空(coverage deficit)*…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-14

标准双向视频扩散模型在处理长因果链(如多个球连续碰撞)时性能显著下降,且增加去噪步骤无法弥补,因为其去噪循环并不提供可扩展的串行计算能力——这一现象被定义为**序列性差距**。

视频扩散模型能否正确预测多个物体依次碰撞的动力学结果?该研究通过多球硬球动力学控制实验,发现标准双向视频扩散模型(如Diffusion Transformer等)在预测依赖事件的序列(如球A击中球B、球B再击中球C)时,随着因果链长度增加,推理性能持续下降;而长度匹配但无球间碰撞的单球控制实验中退化几乎消失,证明问题不来自视频时长,而来自**事件依赖结构*…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-14

在聚合准确率上,大语言模型(LLM)对任务无关上下文看似鲁棒,但这一稳定性掩盖了显著的逐样本不稳定性——即使是随机字符构成的伪词也能导致部分样本的预测翻转,且翻转有升有降,这表明聚合指标无法揭示模型在长尾风险上的脆弱性。

随着大语言模型能力增强,它们越来越多地被部署在上下文丰富的场景中,任务输入常伴随长段、部分无关的上下文。研究者通过向基准测试问题前添加任务无关上下文,观察模型在聚合准确率上的表现,却发现:最先进的模型在聚合层面似乎不受影响,但逐个样本分析时,预测结果存在显著翻转。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-14

TerraZero 是一个纯程序化生成的驾驶仿真与自对弈训练栈,仅依靠强化学习从零开始训练,无需任何人类演示或后备规划器,在 InterPlan 长尾基准上成为首个超越更大规模学习型规划器的完全学习策略,并实现了零样本跨城市泛化(包括无监督涌现左手交通驾驶)。

训练鲁棒的自动驾驶代理需要仿真器同时满足三个要求:足够快以支持大规模强化学习,足够真实以在真实地图结构上产生贴合实际的行为,足够多样以覆盖安全关键的长尾场景——而这些场景在记录数据中极少出现。现有仿真器在速度、真实度或多样性上存在权衡,难以兼顾。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-14

本研究提出可在激活层面实施反事实干预的“报告坐标夹”,使语言模型在面对非证据性激励压力时(如用户自信、声望压力)保持内部信念不变(抵抗),同时仍对真实证据做出响应(更新),两指标在基准测试中联合达到1.00(Wilson 95% CI [0.99,1.00]),但当前仅作为可构建参考下的因果证书,直接部署的版本存在损失。

对齐的语言模型在非证据性激励压力下(例如用户表达高度自信、对话中的声望效应、用户要求的重述)会错误报告:即使内部信念未改变,模型也可能同意用户或过度表达确定性。作者将此定义为**内部激励相容性(Internal Incentive-Compatibility, IC)**的失败,即模型报告未能遵循“抵抗禁止影响、响应许可证据”的因果契约。研究问题:如何学习…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-14

AI基础设施的快速扩张正加剧能源消耗与电子废物问题,同时AI生成的虚假内容侵蚀公众信任,阻碍多项可持续发展目标(SDGs)的进展;亟需将AI技术重新对准SDGs方向。

本文是一篇发表于Nature Machine Intelligence的通讯文章(Correspondence),系统梳理了AI技术发展对联合国可持续发展目标(SDGs)带来的多重风险,并呼吁重新校准AI发展方向。文章指出,数据中心在2024年已消耗全球约1.5%的电力,预计到2030年其能源需求将翻倍以上;在激进增长情景下,生成式AI产生的电子废物到20…

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-07-14

PalmClaw 是一个运行在手机上的开源 LLM 智能体框架,通过将设备能力封装为参数明确、结果结构化的“设备工具”,相比 GUI 操作的基线方法实现了任务成功率提升 11.5%、完成时间减少 94.9%,并降低了部署负担。

传统 LLM 智能体多运行在桌面或服务器上,通过调用工具执行多步任务。手机作为广泛可及且包含用户数据、传感器和日常应用的环境,同样适合智能体部署。然而现有的移动智能体主要依赖图形用户界面(GUI)操作(如点击、滑动、输入),这种方式形成冗长且依赖界面的动作序列,无法直接访问设备底层能力,且执行边界难以定义。PalmClaw 旨在解决上述问题,提供一个原生运…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-14

本文提出 FormalAnalyticGeo,一个全自动、可扩展的神经符号框架,用于生成多模态解析几何问题,并产出包含 7000 余道验证题目的数据集 AnalyticGeo7K,生成答案的中位相对误差仅为 0.70%。

多模态大语言模型在数学推理上取得显著进展,但解析几何领域因标注样本稀缺而研究不足。现有图表生成方法无法满足解析几何需求:模板方法不能处理约束驱动的布局,生成模型缺乏精确渲染带标注圆锥曲线的几何精度。因此,需要一种可规模化、自动生成高质量多模态解析几何问题的框架。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-14

在冻结的小型代码大语言模型(0.5-1.5B参数)上,通过PoPE方法的安慰剂对照测试表明:无论是通过提示通道还是权重通道,错误内容本身并未带来显著的解锁优势——提示通道中内容消融安慰剂甚至略优于实时错误模式(12 vs 10),权重通道中错误内容适配器与无干预基线持平(8-8,p=1.0),而SHA混乱安慰剂反而领先(10);内容归因的优越性未被确认。

已有自修复文献在测量模型根据失败尝试后的错误信息进行重试时,缺乏安慰剂对照控制。本文将失败程序视为“猜想”,执行反例视为“相对于神谕的反驳”,并引入PoPE(Popperian Placebo-controlled Evaluation)方法学,用以衡量“能够证伪LLM生成代码的证据是否可以被同一模型操作化利用”。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-14

本文提出**集成控制流滤波(EnCF)**,通过随机控制流和伴随匹配实现**隐式数据同化**,在处理非高斯、多对一、多模态和隐式观测模型时优于传统卡尔曼型滤波。

数据同化从模型预报和观测中估计动力系统的状态。但许多观测机制是**多对一、隐式、非光滑**或仅能通过仿真访问,无法提供传统集成滤波所需的残差结构或似然指导。作者形式化定义了**隐式数据同化**,即将分析律定义为预报分布的能量倾斜,并设计相应算法。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-14

在包含随机性和隐藏信息的对抗性桌游中,为集成确定性MCTS引入两种动态资源分配机制(动态确定性数量与动态仿真分配),可以在迭代和时间约束下产生统计学显著的强度提升。

模拟算法(尤其是蒙特卡洛树搜索MCTS的多种变体)适用于高不确定性环境,例如含有大量随机元素和隐藏信息的对抗性棋盘游戏。本文针对集成确定性MCTS(Ensemble Determinization MCTS)提出了一系列增强,核心问题是如何动态分配计算资源以提升搜索效率。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-14

大型语言模型(LLM)智能体在执行任务时普遍缺乏任务复杂度感知能力,倾向于“最大上下文优先”策略导致大量冗余消耗;本文提出的E3方法(估计-执行-扩展)在保持100%成功率的同时,将成本降低85%、令牌使用减少91%、审查文件数减少92%,是迈向工程接地AI(EGAI)的关键一步。

LLM智能体在自动化多步工程与信息学工作流时,很少主动评估一项任务实际需要多少努力。它们通常执行“最大上下文优先”策略——重新读取已经看过的文件和依赖项——使一行代码的编辑演变为一次小型代码库审计。本文指出缺失的核心能力是**任务感知执行范围估计**:在投入预算之前判断任务难度、真正需要的信息以及最短可靠路径。为此,作者形式化了“最小充分执行”与“智能体认…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-14

DermDepth是首个针对皮肤科领域的单视图度量尺度3D重建模型,通过合成数据集D-Synth训练,可将真实皮肤镜图像的度量尺度误差从超过16倍降至1.1倍以下,无需额外硬件或多次拍摄。

皮肤科临床实践中常使用普通相机拍摄皮肤表面,以测量和追踪病变大小、形态和纹理,用于伤口或皮肤癌筛查、监测和诊断。现有研究高度集中于2D方法,而3D信息对此类目标自然更有优势。本文提出DermDepth,证明在无需额外硬件或多次拍摄的情况下,可实现皮肤镜和宏观图像的密集单目3D重建、度量尺度测量以及丰富的表面法线纹理估计。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-14

cgDDI 框架通过混合方法合成多样皮肤影像(特别是深肤色和罕见病),将仅含 656 张真实图像的数据集扩展 400 倍以上,在恶性分类任务上达到 90.9% 的 SOTA 准确率,并显著改善跨人群公平性。

皮肤科诊断需要在不同人群上公平地工作,但系统性缺失专家标注图像,尤其是深肤色和罕见病的样本,阻碍了公平方法的开发。研究引入 cgDDI(可控多样皮肤影像生成)框架,旨在低成本、高效率地生成多样化的皮肤病图像,以弥补数据缺口。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-14

本文证明,**离散扩散语言模型**(而非自回归模型)可以通过少量并行去噪步骤直接转录语音,在 LibriSpeech test-clean 上达到 6.6% 的词错误率,且训练参数量仅为骨干模型的 0.16%。

自动语音识别(ASR)长期被自回归解码器主导,每步输出一个 token。作者探索是否可以用**离散扩散语言模型**代替自回归解码器,通过少量并行去噪步骤逐步精炼整条转录。他们以 DiffusionGemma(26B 混合专家模型,使用均匀随机 token 离散扩散而非吸收掩码方案)为骨干,训练一个“音频原生”接口。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-14

本文提出一种名为 GyroFlow 的潜在生成模型,可以直接从噪声生成五维相空间中湍流的统计稳态快照,绕开高成本的瞬态模拟,并在生成质量和计算速度上超越现有自回归、降阶及其他生成式方法。

许多非线性物理系统(如等离子体中的陀螺动力学湍流)在达到统计稳态之前,会经历一个初始瞬态阶段,其中扰动增长并发生非线性相互作用。直接数值模拟必须完整解析这一瞬态动力学,计算成本极高。针对流体动力学,已有大涡模拟等降阶方法,但对于陀螺动力学等系统,尚缺乏同样有效的闭合模型,高保真模拟仍是必需。现有的代理模型(如自回归方法)存在误差累积问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-13 信息日期 2026-07-21

本文提出基于选择性状态空间的两种适配器(MaLoRA 与 MaRA),在冻结大语言模型上通过 token 级动态缩放和上下文级检索,使推理准确率在三个骨干模型和两个基准上平均提升 +6.8 F1(+10.5% 相对),且 token 级增益在长上下文压力下保持。

标准低秩适应(LoRA)为每个任务学习一个静态更新矩阵,该矩阵对所有输入 token 相同,无法捕捉 token 级或实例级的状态变化。本文研究如何将选择性状态空间递归引入适配器,使适配过程具有输入依赖的动态性和跨 token / 跨段的状态记忆。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-13

GPT-5.6 在多项标准基准测试中领先、单任务官方标称成本约为 Fable 5 的一半,但第三方评测的智能指数接近 Fable 5;作者实测深度项目协作时表现死板、耗时巨大、额度消耗快,实际成本优势存疑。

OpenAI 全量上线 GPT-5.6,官方宣称在 Terminal-Bench、DeepSWE 等基准上全面领先,单任务成本约为 Fable 5 的一半。第三方机构 Artificial Analysis 的 Sol 智能指数显示 GPT-5.6 得 59 分,贴近 Fable 5 的 60 分;Codex+Sol 以 80 分登顶编程榜单。作者实测一个…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · benchmark-evaluation
每页 20 条