AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 101-120 条,共 2259 条
第 6 / 113 页
事件日期 2026-09-02

EarlyEval 提出“早期结果预测”这一评估降本新轴:在 agent 执行过程中用一对 LightGBM 成功/失败分类器判断最终结局,一旦置信度过阈值就提前终止运行,从而在只让 agent 解决率平均变化 1–2 个百分点的情况下,最多减少 44.1% 输入 token 和 29.4% 输出 token。(待核实)

评估 LLM agent 对模型开发至关重要,但运行成本越来越高;一个前沿模型在 agentic benchmark 上完成一次评估可能花费数百到上千美元,并在迭代中反复支付(待核实)。现有基准蒸馏(benchmark distillation)通过减少评估任务数量降本,但没有降低每个任务内部的执行成本。EarlyEval 正是针对“任务内”成本:利用“最…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-02

论文摘要称,基于德·菲内蒂定理和线性规划构造的荷兰赌检验发现,语言模型的概率预测存在显著不连贯性:事件间的逻辑关系更丰富时,不连贯性增加;加入无关上下文细节可使不连贯性提高约一个数量级。

论文指出,人们越来越多地用语言模型支持生活决策,很多这类决策涉及概率预测,例如“重大人生事件、自然灾害或经济结果的可能性”。 用户可能默认这些预测来自一个连贯的世界模型。论文的研究问题是:语言模型的概率预测是否内部自洽?在结果尚未揭晓或无法观测时,能否评估这种自洽性?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-02

该工作提出用“预测状态匹配”(predicted-state matching)训练判别式世界模型,使网络智能体在测试时通过预测并区分不同动作导致的网页状态来选择更优动作,相关实验表明该方法优于传统监督式下一状态预测训练的世界模型。

Discriminative World Models for Web Agents

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-02

DiscoSign 是一个面向语篇(discourse)级别的手语翻译框架,提出用模块化大语言模型(LLM)处理“文本→手语标注(gloss)”中的语篇现象。摘要称,相比“仅句子翻译”,该方法显著改善了空间一致性和实体追踪,同时保持有竞争力的单句翻译质量。

DiscoSign: Discourse-Aware Text to Sign Language Gloss Translation

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-02

这篇Nature综述指出,AI驱动的物理实验设计正从“调整个别参数”发展为在广阔硬件配置空间中搜索最优解,甚至提出全新实验布局;这些AI发现的结构常挑战传统设计惯例,却能达到或超过人工设计的性能,未来有潜力开辟探索宇宙的新途径。

本文是一篇发表于《自然》的综述(Review),在线发表于2026年9月2日。它研究一个核心问题:人工智能如何参与物理学实验的设计?文章将实验设计形式化为“在受实际约束的硬件配置空间中寻找最优解”,并围绕四个指导问题展开:(1) 如何设计表达性强的搜索空间;(2) 如何构建快速可靠的模拟器;(3) 如何把科学目标转化为可计算的目标函数;(4) 如何开发能同…

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-09-02

研究团队将天然蛋白结构域与人工智能设计出的、自然界中不存在的蛋白组装体相结合,制造了名为STV(合成转运载体)的RNA递送工具;其中最优候选STV-C8的RNA递送效率比天然病毒载体和临床使用的脂质纳米颗粒(LNP)高数个数量级,并具备可编程的细胞靶向性。

病毒经过数十亿年进化,已成为高效的基因递送载体,但大多数病毒衣壳在大小和形状上趋同。它们适应自然环境所需的部分特性,在受控的基因工程应用中未必必要,甚至可能成为劣势。 本文提出的问题是:能否利用生成式AI蛋白设计工具制造不依赖自然进化路径的蛋白组装体,并将其功能化为核酸转运载体? 作者将天然蛋白功能域与AI设计的合成蛋白组装体结合,构建了超过100种“自下…

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-09-02

本文用 Copula 理论建立了迭代数据一致反演(iDCI)与原始联合数据一致反演(DCI)解之间的关系,并证明:iDCI 收敛后的残余差异可由观测联合分布与预测联合分布的 Copula 完全刻画;若施加精确的 Copula 变换,则可以恢复原始 DCI 解(原文证明细节待核实)。

数据一致反演(DCI)构造概率测度,使其前向推布(push-forward distribution)与观测数据一致。迭代数据一致反演(iDCI)将这一框架扩展到广义随机反问题,通过顺序施加多个前向约束来求解,从而避免直接逼近高维联合密度。然而,iDCI 与原始联合 DCI 解之间的关系此前尚不清晰。本文试图用 Copula 理论澄清这一问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-02

(待核实)CodePoisonRAG 是一种面向“检索增强代码生成”(RACG)的黑盒、定向上游知识投毒框架:攻击者不需要修改大模型,也不访问受害者的检索/生成系统,只要向知识库注入少量与任务匹配的带毒代码制品,就可能让模型生成带攻击者指定软件弱点(CWE)的代码。

CodePoisonRAG: Knowledge Poisoning Attacks on Retrieval-Augmented Code Generation

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-02

Cliff 是一种面向大语言模型 RLVR 后训练的奖励塑形策略。它用一个现成的 LLM 教师找出每次推理轨迹中的“第一个错误”,把轨迹切成正确前缀和错误后缀,并转换为 token 级优势:前缀给正反馈、后缀给负反馈。据论文摘要,Cliff 在 12 个场景中一致提升推理性能,比 on-policy distillation 高 15%、比标准 GRPO…

基于可验证奖励的强化学习(RLVR)已成为大语言模型后训练的重要范式,但依赖结果奖励,对中间推理过程的反馈较粗。 已有增强方案往往需要额外约束:例如依赖专门的奖励模型,或假设教师与学生推理模式相同。 Cliff 的切入点是:一旦推理出现第一个错误,后续推理已经以无效前缀为条件,继续评估“后面的推理”能提供的额外信息有限;因此,定位第一个错误比逐步过程打分更…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-02

候选摘要显示:恢复位置本身并不单独决定性能。RAW 域恢复可以优于最好的通用 RGB 恢复模型;但若 RGB 恢复模型在训练中考虑了 ISP 变换,则能取得最佳整体性能。关键在于恢复模型与目标成像流水线之间的对齐程度。

现代相机通过图像信号处理器(ISP)将 RAW 传感器测量值转换为 sRGB 图像。 该工作以 ISP 为中间环节,比较两种“盲恢复”放置方式: A:ISP 之前,在 RAW 域进行恢复; B:ISP 之后,在 sRGB 域进行恢复。 基准覆盖范围,据候选摘要: 四组智能手机设备; 两个学习式 ISP; 三种退化场景:噪声、模糊、噪声与模糊联合退化; 若干…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-02

AutoCompass 提出一种利用含噪绝对位姿标签(如原始 GPS)来训练“神经地图匹配器”(neural map matcher)的监督方法,并声称不需要航向标签;模型仅从原始 GPS 标签训练就能自动学会准确航向。在驾驶和以自我为中心的视频基准上,该方法一致优于通常强依赖绝对位姿标签的对照训练方式。

视觉定位中,神经地图匹配器用于估计一张图像相对于某张 2D 地图的 3 自由度位姿。传统方法需要在大规模地理参考图像上训练,而这些图像的位置和航向标签往往含有噪声,会影响训练出的模型。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-02

本文提出一个名为 AICOME(AI COntextual MEasurement)的验证框架,用于检验“由 AI 从受访者信息中构造的测量”是否能恢复情境模型中的个体和群体层面效应;基于 2022 年中国家庭追踪调查(CFPS)的职业分组验证显示,该方法在数据丰富时能恢复调查变量中大部分情境信息,但存在明确边界条件。

研究者越来越多地使用人工智能来构造传统调查中缺失的社会、组织与职业特征测量。然而,现有做法往往把 AI 测量视为“对回答的预测”,忽略了它在情境模型(contextual models)中可能同时具备的群体与个体层面分析价值。本文提出 AICOME 框架,回答的核心问题是:

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-02

语音脑机接口(speech BCI)目前因数据集、记录方式、语音类型和词汇表不同而缺乏统一的进展度量;本文提出开放词汇互信息(Open-Vocabulary Mutual Information, OVMI),用一个信息论指标衡量解码器相对“用户可能想表达的词语分布”传递了多少信息,从而让不同条件下的系统可以在同一“通信尺度”上进行比较。

语音脑机接口将神经活动翻译为语言,有望帮助瘫痪患者恢复言语能力,也可能催生更自然的人机交互。但该领域的不同系统在数据集、记录方式、语音类型、词汇表等方面差异很大,各自报告的分数难以直接比较。本文指出,这背后有两个尚未解决的问题:

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-01 信息日期 2026-09-03

Last Translation Benchmark(LTB)是一个面向机器翻译(MT)的“挑战型”活数据集:收集能令当前领先翻译模型出错的人类撰写并经同行评审的文本、图像、音频、视频示例,并为每个示例配备人工编写的验证规则,以便进行更可靠、可操作的未来评估。

Last Translation Benchmark

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-01

Anthropic 于 2026 年 9 月 1 日发布 Enterprise Frontier Safeguards(EFS),使企业客户能将监控数据存储在自己控制的云基础设施中、由客户自己的团队审查警报,从而在客户掌握数据控制权的前提下,获得针对前沿模型滥用与自主异常行为的检测能力。

2026 年 9 月 1 日,Anthropic 宣布推出 Enterprise Frontier Safeguards(EFS),一个结合“零数据保留(Zero Data Retention, ZDR)的隐私”与先进滥用检测的解决方案。 背景是 Mythos 级(Mythos-class)模型(如 Claude Fable 5.1)大幅提升了智能与智能体…

产业观察 · 原始来源:Anthropic 博客 · ai-industry
事件日期 2026-09-01

新加坡Physical AI公司Ropedia发布第四代多模态采集系统HOMIE Gen2并全球发售,提出“人类经验规模化驱动机器人能力”的经验扩展定律,把机器人训练数据的产能从机器人保有量转向人口规模,以显著更低成本和更快部署速度采集人类经验数据。

据腾讯研究院AI速递(2026-09-01)报道,Ropedia发布HOMIE Gen2。其核心问题是:机器人能力提升所需的物理交互数据,能否不依赖机器人本体数量,而通过人类规模化佩戴/使用采集设备来获得?Ropedia给出的答案是“无本体采集”,并配套提出经验扩展定律。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-09-01

根据OpenAI官方页面元数据,Astra是第一个在Preparedness Framework下达到“严重网络安全能力”(Critical cybersecurity capability)阈值的OpenAI模型,并配备了更强的发布安全保护措施。

OpenAI发布“Path to Astra”页面,介绍Astra模型的关键能力与前沿安全防护。该条属于行业动态(Track: industry)。由于原始正文未抓取到,具体发布时间、发布背景和页面详细内容待核实。

产业观察 · 原始来源:OpenAI · ai-industry
事件日期 2026-09-01

OpenClaw 发布 v2026.8.1 版本,被描述为“史上最大更新”,由 933 名贡献者提交超 1.6 万个 PR,全面重构核心模块;但部署维护、Token 成本与安全风险仍待解决,国内“百虾大战”热度已明显回落。

OpenClaw 发布 v2026.8.1 版本,即报道所称的“2.0 史上最大更新”。该项目共有 933 名贡献者提交超过 1.6 万个 PR,约占项目历史合并代码的一半;为此,项目罕见停更近七周。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-09-01

OpenAI发布了一项新能力,使医疗保健组织可以将电子健康记录(EHR)及其他行业数据连接到ChatGPT,帮助临床医生更安全地获取患者背景、医学研究等信息(具体细节待核实)。

根据现有元数据,OpenAI 宣布医疗保健组织现在可以将 EHR 和额外的行业数据连接到 ChatGPT。候选摘要称,ChatGPT 可以连接受信任的医疗保健数据,帮助临床医生安全地访问患者上下文、医学研究等。由于未能抓取原始正文,详细事件内容待核实。

产业观察 · 原始来源:OpenAI · ai-industry
每页 20 条