AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 701-720 条,共 2259 条
第 36 / 113 页
事件日期 2026-08-14

直接偏好优化(DPO)可以把一个无监督的结构条件蛋白语言模型(ESM-IF1)对齐到实验稳定性数据,得到 ProteinDPO。它在稳定性打分上优于无监督原版和监督微调(SFT)版,且能推广到大型复合物结合亲和力预测及流感血凝素三聚体稳定化。

无监督蛋白质生成模型可以在没有任务特定标签的情况下预测功能,但通常不如任务专用模型。作者将这种现象归因于“对齐差距”(alignment gap):无监督训练学到的规则与用户关心的功能不一致。

学术前沿 · 原始来源:nature.com · generative-model
事件日期 2026-08-14

YOPO 在不改变冻结大语言模型权重的前提下,用一个小型残差重构网络解决“引导写入”与“充分性判读”互相干扰的问题,使模型在单次前向传播中既能回答也能弃权;在 Qwen2.5 1.5B 的 alphaNLI 上,三路准确率从冻结基线的 0.375 提升到 0.798,并超过需要两次前向传播的参照方案。

论文认为,冻结语言模型在推理任务上有两个相互关联的弱点:一是没有充分使用自身残差流中已经编码的证据;二是当输入信息不足以回答时不能识别,从而产生“编造式回答”(confabulation)。 已有两条研究路线分别作用于同一条残差流: 条件引导探针(conditional steering probe)在中段层写入残差流,提升冻结主干的推理准确率; 零样本充…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-14

Wyvern 是一个面向“有据可依(grounded)多模态技术报告”自动生成的多智能体框架。作者报告它生成的图表信息量更高、报告更有用,并在引文召回率和精确率上显著超过基线;但当前可获取材料仅为摘要,系统细节和评测过程待核实。

背景:作者认为在 AI 驱动的创新时代,知识增长速度快,人类难以跟上;生成模型虽越来越多用于内容合成,但常常缺乏信息依据(grounding)。 问题:如何自动生成既包含多模态内容(图像、表格、文本),又能提供支撑参考文献、且内容经过依据校验的技术报告。 提议:Wyvern 多智能体框架,将报告生成与内容 grounding 结合,并引入“论断自动修订(c…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-14

Universal Thermodynamic Interatomic Potentials for Crystalline Materials

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-14

Twin 系统在测试时让前沿编码智能体编写一个可执行世界模型,通过“数字孪生”回放验证和反例修复来玩规则未知的网格游戏,在 ARC-AGI-3 上通关 179/183 关(97.8%),并将同一基础模型在基准上的得分从 7.8% 提升到 93.3%。

研究问题:如何在游戏规则与目标都隐藏的情况下,仅靠模拟和交互自动构建一个可用的世界模型,完成持续学习任务(如 ARC-AGI-3 游戏)。 传统做法是为每个任务手工设计定制世界模型;Twin 则希望自动构造世界模型,而不是针对每个游戏单独设计。 每个游戏都隐藏规则和目标,Twin 只从仿真与交互中构建出这些规则与目标。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-14

知识编辑虽被寄望于低成本更新大语言模型,但现有方法把模型当作可独立修改的“模块化知识库”,忽视了知识之间的相互依赖;未来应转向考虑演绎闭合、模型信念与上下文依赖的“有原则”编辑方法。

本文是发表于 *Nature Machine Intelligence* 的 Perspective(观点文章),发表于 2026 年 8 月 14 日。作者指出,大语言模型日益具备多步演绎、因果推断等复杂推理能力,而现有知识编辑技术大多将事实视为可独立修改的条目,导致编辑后的知识可能与模型既有推理链条冲突,产生“混乱的涟漪效应”。文章呼吁知识编辑必须尊重…

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-08-14

这篇发表于 *Nature Machine Intelligence* 的综述文章认为,计算机听觉正从传统任务范式走向以大语言模型(LLM)为核心的“通用听觉智能”,关键路径是将音频理解、音频生成、语音交互和音视频融合统一纳入基础模型框架。

本文是一篇 Review Article,在线发表于 2026 年 8 月 14 日。 研究问题:如何让机器像人一样自然地“听”和“说”?如何把音频模态嵌入大语言模型,使系统具备更深层的声音语义理解、更自然的音频生成,以及更像人类的语音交互能力? 综述聚焦四个关键领域:音频理解、音频生成、基于语音的交互、音视频联合理解。

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-08-14

The Past and Future of AI Scientists

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-14

The Dynamics of Intelligence Explosions

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-14

在冻结图像嵌入(如CLIP)的风格分类任务中,改用“艺术家隔离”评估协议后,5-NN风格准确率从0.87降至0.77,且下降极度不均衡;这表明此前报告的高准确率有一部分来自对画家个体的识别,而非真正的艺术风格理解。

研究问题:CLIP等冻结视觉嵌入被越来越多用于按艺术史风格对绘画分类,且报告准确率很高。本文追问:这种准确率究竟反映了模型对“风格”的理解,还是对“个体画家”的识别?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-14

根据候选摘要,该工作主张把“从多个来源中得出结论”拆成“解释每个来源”和“聚合各解释”两个独立环节,并固定二者之间的证据元组接口,比把所有来源拼接进一个提示更合理;摘要给出的一个实例中,该方法达到 0.921 AUPRC,而手工基线为 0.805(待核实)。

根据候选摘要,论文针对一类常见做法:想让语言模型根据很多来源得出结论时,通常把所有来源拼接成一个长提示。作者认为这混淆了两种需求不同的操作:

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-14

在PM2.5监测数据有限且源域与目标域分布不一致的条件下,保留目标域专属分支、并允许源编码器在目标域监督下进行适应的双编码器迁移框架,能够比仅用本地数据或直接迁移取得更好的短时预报性能,并降低负迁移风险。

短时PM2.5预报在目标域观测数据不足时面临两难:只使用本地数据训练的模型难以捕捉复杂时间动态,而直接迁移源域模型又可能因源域与目标域统计特性不同而产生负迁移。该研究针对这一问题,提出了一种“移位感知”的迁移学习框架。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-14

SheetCompass 提出用层次化关系图显式建模工作簿内和工作簿间的结构关系,并用记忆驱动智能体进行电子表格推理与自动化,避免传统方法把多维表格结构“压扁”成字符串而丢失关键语义。

电子表格广泛用于组织、分析和操作半结构化数据,但大语言模型(LLM)在自动化地理解真实工作簿时仍面临困难。真实工作簿通常包含:

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-14

根据 arXiv 摘要,Rollplex 是一个面向视觉语言模型(VLM)强化学习后训练的运行时系统。它把 reference scoring 和 actor training 中的前缀计算移入 rollout 解码窗口,并通过阶段感知内存管理与张量并行感知的权重共享,在保持同步 on-policy 更新的同时,在 32 块 H800 GPU 上比串行共置…

视觉语言模型(VLM)为具身智能体提供从视觉观测和语言指令中推理并行动的能力;强化学习(RL)后训练利用任务反馈增强这种能力。然而,当前 on-policy RL 运行时通常把 rollout、reference scoring、actor training 作为严格串行的阶段执行。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-14

RecipeNet 是一种针对配方数据的层次化 Transformer 架构,通过在步骤内编码字段级交互、跨步骤建模顺序依赖,在多个配方数据集和任务上稳定优于现有表格学习模型;其具体性能提升幅度需待核实。

材料合成、药物配方、工业制造等领域的“配方数据”由有序步骤序列构成,每一步包含异构结构化字段。现有表格学习方法通常把此类结构展平成固定 schema,难以捕捉层次化字段交互和过程依赖。RecipeNet 旨在解决这一建模缺口。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-14

在“让公众投票”的道德AI偏好收集流程中,开发者对特征范围、投票者样本和问题表述的选择会影响最终聚合偏好,因此投票式对齐无法仅靠聚合保证公平与透明;至少每个阶段都应被审计并披露。

随着AI越来越多地参与社会中的道德决策,一种主流回应是“道德偏好 elicitation”(moral preference elicitation):研究者请参与者对假设道德困境投票,再用聚合后的偏好训练AI策略。论文指出,在投票发生之前,开发者已经通过三个关键选择塑造了整个过程:特征范围(feature scoping)、投票者抽样(voter sam…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-14

PACE-Bench 是一个基于模拟器的物理适配评测基准,通过 144 个“源环境→突变目标环境”的代码演化任务检验自进化智能体在物理规则变化后的恢复能力;当前最强方法也只能解决约三分之一的全量任务,表明该基准远未饱和,且机制重设计是核心瓶颈。

自进化智能体能够从交互经验中改进未来行为,但现有评测通常假设执行条件固定,未测试条件变化后的恢复能力。为填补这一空白,研究者提出 PACE-Bench,要求智能体在源环境中成功的代码设计失效后,利用诊断性沙箱反馈在有限尝试预算内将代码迭代适配到新的目标物理环境。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-14

该论文提出用数据驱动的替代模型从OD需求直接近似均衡交通弧流量,以缓解道路养护调度中反复求解均衡分配模型的计算瓶颈,并在新泽西州纽瓦克地区的真实交通数据上验证了可行性。

道路网络层面的养护规划需要在通行能力下降的情况下反复评估均衡交通流。成熟的均衡交通分配模型虽然准确,但重复求解计算开销过大,难以嵌入养护调度优化问题中。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-14

本文在非参数分布时序差分学习框架下证明,基于单条马尔可夫轨迹估计回报分布时,Polyak-Ruppert 平均估计量的根号 T 误差弱收敛到 Cramér 空间中的中心高斯随机元;条件自助法也有同一极限。该结果支撑方差、CVaR、期望短缺、expectiles 等光滑泛函,以及由 CDF 方程刻画的分位数等非光滑泛函的在线推断。

研究问题:固定策略下,如何从单一马尔可夫轨迹在线推断回报分布的函数泛函,而不只做点估计?文章关注分布时序差分学习中的统计推断,特别是 Polyak-Ruppert 平均估计器和 bootstrap 的渐近性质。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条