AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 361-380 条,共 2259 条
第 19 / 113 页
事件日期 2026-08-26

在SwarmWorld中,最初同质的语言模型(LLM)智能体无需预设角色或配方,仅通过共享环境中的持久化痕迹(stigmergy)即可自组织出技术社会;共享社会能产生更广泛、更有韧性的技术组合,但在最强单个工件上,隔离搜索仍具竞争力。

现有大多数多智能体系统依赖直接对话、预定义角色或集中式工作流,去中心化智能体能否自行构建功能性技术并超越独立搜索,仍不清楚。SwarmWorld通过一个空间模拟环境研究这一问题:初始同质的LLM智能体在无指定角色或配方的条件下,通过环境介导的协作涌现出技术演化。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-26

StreamPI 是一个不引入额外参数的流式多模态时间建模框架,可以让单帧 VLA 模型(如 pi0.5)获得时间推理能力,并在真实机器人任务和 LIBERO 模拟基准上的多样化任务中表现优于 pi0.5(具体性能数值待核实)。

StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-26

Robust CurveMoE 提出一种将模式连通性(Mode Connectivity)与混合专家(MoE)结合的防御框架,通过低损耗路径连接针对不同扰动范数特化的模型,在 CIFAR-100 和 ImageNet-100 上相比最强基线将 Union 准确率分别提升 2.37 和 2.13 个百分点。

多范数对抗防御旨在保护神经网络免受不同范数约束(如 L∞、L2、L1 等)下对抗扰动的影响。现有方法通常在一个参数配置中同时优化多个相互竞争的鲁棒性目标,导致训练成本高、鲁棒性权衡不佳。Robust CurveMoE 尝试利用模式连通性,让不同范数特化的模型通过低损耗路径连接,并借助混合专家架构实现高效的多范数防御。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-26

RefVideo-6M 是一个包含 500 万视频编辑样本和 100 万图像编辑样本的大型参考引导数据集,它把无伪影的真实视频作为编辑目标,并提供约 600 万视觉参考,以缓解现有数据集目标视频伪影多、视觉参考缺乏的问题。

近年来,视频编辑的进展在很大程度上依赖大规模指令式数据集。但已有数据集有两个关键局限: 目标视频通常由自动编辑模型生成,可能带有可见伪影,导致监督信号不可靠; 多数公开数据集主要依赖文本指令,缺少对精确编辑、身份保持和可控编辑至关重要的视觉参考。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-26

本文提出名为 **R³** 的后训练方法,将现成的视觉语言模型(VLM)训练成“机器人推理器”,使其生成自由形式的自然语言推理,作为测试时计算(test-time compute)信号来引导底层操作策略,并在两个长时程操作基准上显著优于仅使用指令的模仿学习基线。

语言推理能让基础模型在推理时投入更多计算来处理难题,例如任务分解、约束跟踪和未来后果预测。但在机器人操作中,长时程任务需要跟踪部分进度、推理物体关系、从错误中恢复,并引导噪声较大的底层策略。本文研究的问题是:**VLM 能否被训练为直接用自然语言推理来引导底层操作策略?**

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-26

Prefix Sliding 通过只保留“前缀 + 最近窗口”中的 token,并丢弃中间推理 token,把长推理的内存需求变为有上限,让测试时缩放能够更高效地扩展到超长推理轨迹;无需训练即可让现有模型提速约 3 倍并保持性能。

测试时缩放(test-time scaling)通过增加推理时计算来提升模型表现,例如让模型推理更久。然而,模型在全注意力下必须把整条推理轨迹保留在内存中,因此需要长思考的困难任务可能成本过高。论文发现,随着推理继续,大部分中间推理 token 的重要性下降,从而质疑是否值得一直保留它们;为此提出 Prefix Sliding。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-26

PlanSightRAG 是一个直接对图纸图像建立索引并进行推理的视觉优先多模态 RAG 框架;在五个州交通部标准图纸的零样本检索上达到 91.47% Recall@5,在合成合规图纸上,只有在提供预解析规则阈值时才达到 100% 判定准确率。

土木基础设施合规检查长期依赖工程师人工阅读传统二维图纸。基于 OCR 的自动化流程会剥离图纸中对于理解至关重要的几何与布局信息。PlanSightRAG 提出直接基于图纸图像(而非 OCR 文本)进行检索和推理的方案,以自动化标准图纸的问答与合规检查。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-26

PPE 是一个由自然语言查询直接驱动的自主 AI 系统,能够自动完成多模态地理空间数据的检索、融合与模型选择;在摘要报告的多项任务中,它超过了人工调参的专家基线和公开最优模型,例如将美国 CDC 21 项健康指标的平均 R² 从 60.0% 提升到 76.8%。

粮食安全、灾害风险、疾病暴发和社会经济脆弱性等全球挑战需要高保真地理空间建模。 当前构建“行星尺度”预测模型的主要瓶颈是数据生态碎片化:需要人工完成数据检索、多模态数据整理与融合,并反复迭代模型选择。 PPE 的目标是将这一端到端流程自动化,让用户只输入自然语言查询,即可获得定制化的地理空间预测结果。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-26

标准OCR技术在处理真实身份证件时存在结构性缺陷,字段级错误率难以达到KYC/AML合规所需的99.9%准确率门槛;以LlamaParse为代表的agentic document extraction(智能体式文档提取)通过布局感知与模型路由,将OCR从“逐字符识别”升级为“先理解、后提取”的合规管道。

本文讨论的问题是:为什么标准OCR在KYC(了解你的客户)工作流中无法满足AML(反洗钱)合规要求。

学术前沿 · 原始来源:LlamaIndex 博客 · foundation-model
事件日期 2026-08-26

MyoMechanix 是一个面向负重动作的多模态数据集/基准与推理系统:它将多视角RGB、3D姿态、表面肌电(sEMG)等生理信号与专家标注的健身知识图谱(FKG)结合,并通过组合式推理引擎 CUBIST 做“分解—分析—重组”,从而把动作质量评估从“看视频/姿态的整体打分”推进到可解释、可归因、可生成纠正反馈的教练式理解。

现有动作质量评估(AQA)数据集和方法大多只使用RGB和姿态等视觉输入,忽略肌肉力学等生理动态,且常把动作当作整体模式建模。 这导致难以提供细粒度、基于生物力学的动作反馈。 作者提出 MyoMechanix 来弥补这一缺口:以负重动作为对象,将“动作运动”与“肌肉活动”对齐,并加入专家知识结构以支持组合式评分和可解释评估。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-26

Imitation Learning for Connection-Tableau Construction

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-26

ICON分解通过在多变量框架中同时考虑所有概念和结果,量化每个概念在控制其他概念后所解释的层方差比例,以避免单概念审计将概念间相关性误认为模型真正使用它们的证据。

深度神经网络常利用训练数据中的虚假关联进行预测,即“捷径学习”。基于概念的可解释性方法通常逐个测试某个概念(如患者性别或扫描仪设置)能否从网络层中解码,从而筛查模型是否依赖不该用的概念。但这种孤立评估方式可能把概念之间的相关性误判为模型实际使用它们。ICON分解正是为解决这一审计漏洞而提出。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-26

论文为Transformer注意力中的LoRA更新建立了任务相关的秩-误差理论界,说明LoRA秩的选择可由目标更新的谱尾部能量等因素指导,而非仅凭经验。

LoRA的秩(r)通常靠经验选择。本文从理论角度研究:在固定一个预训练注意力头、一个目标注意力函数和一个下游输入分布时,秩为 r 的 query LoRA 更新能达到的最小期望 KL 误差是多少。 研究同时涉及softmax饱和、多头融合以及查询/键联合更新对秩需求的影响。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-26

该论文提出在自动驾驶规划“承诺前”加入一个由语言引导意图模块驱动的门控层,基于平滑的“意图-几何发散度”评分拦截计划机动;在重放的驶离道路事件和四段碰撞片段中,门控是唯一能修复计划的层,且将评分不确定性视为“弃权”而非“半个冲突”后,误触发率从 9 次/5.9 分钟降至 0.341 次/分钟。

车辆交互中的意图误解会导致反复出现的规划失败。论文研究一个决策层:在走廊包络(corridor envelope)上游、计划机动“承诺前”进行门控,目的是在交互后决策失败实际发生之前预判意图发散并阻止计划执行。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-26

通过微调多语言基础模型 Whisper Small,可以在仅约0.54小时人工转写语音的极低资源条件下,为巴尼瓦语(Baniwa)建立自动语音识别(ASR)初步基线,最佳词错误率(WER)为37.5%,字符错误率(CER)为7.45%。

当前ASR技术得益于大型多语言基础模型而性能显著提升,但多数进展集中于高资源语言;原住民语言仍普遍缺乏语音资源和语言技术。本文针对巴尼瓦语——一种使用于巴西、哥伦比亚和委内瑞拉的阿拉瓦克语系(Arawakan)原住民语言——探索将 Whisper 模型适配到该语言的可行性。研究使用来自语言文档项目的1,373条人工转写录音,总时长约0.54小时,内容主要为…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-26

通过将基于稀疏自编码器的机械可解释性首次引入粒子物理,研究者从一个中微子基础模型的内部表征中识别出经严格验证的物理概念图谱;该图谱虽未被原有的方向重建头利用,却能被一个不确定性头因果性地使用,从而显著提升中值角分辨率。

论文研究的问题是:中微子基础模型内部是否编码了可解释的物理概念,以及这些概念能否被下游任务有效利用。研究对象是一个在 IceCube 数据上预训练、并针对方向重建进行微调的中微子基础模型。作者使用稀疏自编码器对其内部表征进行机械可解释性分析,这是该技术路线在粒子物理领域的首次应用。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-26

DualOPSD 让同策略自蒸馏(OPSD)中的特权教师不再固定:先由学生从特权教师学习,再在同一学生轨迹上让教师向更新后的学生分布移动,从而在 Qwen3-8B 非思考模式下相对 OPSD 提升 AIME 2024、AIME 2025、HMMT 2025 的 avg@12,并在多个规模上减少截断。

OPSD 使用学生模型的一个特权副本作为教师,提供密集监督,不需要外部教师。 已有 OPSD 在训练过程中让特权教师保持固定,但学生的输出分布和输出风格会随训练变化,导致监督信号与当前学生不匹配。 论文提出 DualOPSD,一种非对称交替更新框架,同时调整学生与教师两侧策略,使后续监督能够响应学习者的变化。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-26

在人类阅读与大语言模型(LLM)处理中,概念性信息(conceptual information)与指称性信息(referential information)被破坏时呈现出可区分的加工动态:概念干扰引发更强、更局部、快速衰减的加工代价,而指称干扰引发更弱、更渐进、且更受句界调节的分布式加工过程。

语言意义根植于概念内容,而特定实体的指称则在词进入话语时浮现。该研究旨在考察这两种意义维度在加工动态上的差异:通过分别破坏短叙事中的概念信息或指称信息,追踪人类自定步速阅读以及大语言模型的预测性与表征性加工后果。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-26

在对话理解中,单纯由“局部不匹配”驱动的信念更新会破坏共同基础(grounding)并损害检索表现;相反,一种对“累积不确定性”敏感的保守策略——面对局部不匹配时先保持原有理解,直到不确定性充分积累才进行修正——能够兼顾连贯理解与检索性能。

当说话者指称听话者无法直接看到的场景时,听话者必须决定:是保留当前理解,还是随着新话语到来而修正理解。许多语言系统将“局部不匹配”视为更新信号:与当前理解的偏差越大,就越应该调整。本文质疑这一默认假设,提出对话理解可能更保守——会参照先前理解来解释不匹配的证据,而不是立即修正。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条