AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1741-1760 条,共 2269 条
第 88 / 114 页
事件日期 2026-07-16

teLLMe 将行车记录仪视频标注构建的结构化事件表与 PC 因果结构学习、bootstrap 稳定性检查和 DoWhy 线性回归相结合,并通过 schema‑aware LLM 将自然语言问题映射为结构化因果查询,从而为交通机构从观测数据中估计天气、高峰时段等因素对交通密度的因果效应,返回可解释的“因果卡片”。

交通机构可获取大量视频衍生的观测数据,但这些数据缺乏干预,难以直接回答“降雨如何改变交通密度?”等因果问题。本文提出 teLLMe 系统,旨在对城市驾驶数据集进行探索性因果分析,帮助研究人员从观测数据中生成假设并进行专家推理。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-16

T²MLR 通过在 Transformer 解码过程中引入前一个 token 的中间层表示到当前 token 的早期层,使中间推理状态得以跨时间步持久化,仅用少量网络层(约 20%)的局部循环即可在自然语言预训练和多跳推理微调中一致超越参数匹配的基线模型,且无需从零预训练,可直接改造现有预训练模型。

T^2MLR: Transformer with Temporal Middle-Layer Recurrence

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-16

Symbal 是一个基于现成基础模型的双阶段框架,能够自动检测多模态大语言模型(MLLM)生成图像描述中的系统性错误(即与特定视觉特征相关的重复性错位),并在 SymbalBench 基准上实现了 63.8% 的准确率,相比最强基线提升近 4 倍。

多模态大语言模型在生成图像描述时常引入错误,导致图像-文本对错位。本文聚焦一类称为“系统性错位”(systematic misalignment)的错误——指 MLLM 生成的描述中,一个反复出现的错误与图像中某个视觉特征紧密相关。为此,研究者提出了检测此类错误的任务(systematic misalignment detection),并开发了 Symb…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-16

不确定性度量不是需要公理化的原始量,而是更高层建模决策的结果;通过将严格真损失对应的主观风险分解,可以统一导出认知不确定性和偶然不确定性度量,并为学习理论提供新框架。

作者提出一种新的不确定性量化(UQ)视角:传统观点将不确定性度量视为需要公理和论证的原始概念,而本文认为它们应被视为建模决策的后果。核心问题是:能否通过一个统一的理论框架,从少数高层选择(如严格真损失)出发,自动导出现有的各种认知/偶然不确定性度量,并连接学习理论中的超额风险、近似误差和估计误差?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-16

无监督可见光-红外行人重识别(USVI-ReID)面临两大挑战:模态间巨大差异以及缺少跨模态身份标注。已有渐进关联范式试图逐步弥合差距,但存在两个关键瓶颈——依赖模糊的全局表示、以及开环方式下伪标签噪声不受抑制地传播。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-16

本研究提出了一种结合大语言模型(LLM)与专家审核的自进化标注框架,旨在为抑郁症相关数据集提供结构化、可追溯、符合DSM-5-TR标准的症状级证据和标签生成,在初步研究中提升了标注一致性与可解释性并减少了人工修改工作量。

在心理健康可解释人工智能(XAI)研究中,标注质量是主要瓶颈。现有抑郁症数据集的标签常缺乏结构化证据、症状级论证或与DSM-5-TR标准的可追溯对齐,限制了透明度和下游模型的可解释性。该工作试图解决:如何利用LLM辅助并融入专家反馈,构建自进化、可审计的标注流程。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-16

SearchOS 提出了一种系统级多智能体框架,通过将隐式搜索进度外显化为持久共享状态(前沿任务、证据图、覆盖图、失败记忆),并引入管道并行调度与搜索工具中间件,显著提升了开放域信息搜索代理在长交互历史下的鲁棒性和效率,在 WideSearch 和 GISA 基准上全面超越现有单/多智能体基线。

问题:集成工具的 LLM(Tool-Integrated LLM)已使搜索成为核心能力,但随着交互历史增长,智能体难以跟踪任务进度;当搜索尝试失败时,当前单/多智能体系统可能陷入重复循环,浪费搜索预算并损害最终输出的质量与完整性。 目标:构建鲁棒的开放域信息搜索智能体协作系统,使搜索进度显式化、可持久化、可共享。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-16

SceneBind 提出了一种统一的全模态场景表示,在实例级语义(“有什么”)基础上加入了显式的3D空间结构(“在哪里”),并在跨模态场景检索和音频-视觉定位任务上达到当前最优。

现有的全模态编码器擅长识别场景中的物体类别(实例级语义),但缺乏对物体空间位置和3D结构的显式建模。SceneBind 的目标是让模型同时理解“场景中有什么”和“它们在哪里”,并支持跨视觉、音频、语言三种模态的场景检索与物体定位。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-16

通过协调学习范式(全局帧运动跟踪)、数据策略(on-policy rollout量+参考动作多样性)和模型架构(Humanoid Transformer),行为基础模型(BFM)在人形机器人控制上实现了显著的性能提升,全局模式下平均关键点位置误差(MPKPE)降低82%。

人形机器人控制需要全身自然协调、实时精确响应控制信号,并在多样化环境中鲁棒泛化。行为基础模型(BFM)利用大规模行为数据已展现出更强的表现力、多功能性和泛化能力,但其缩放规律尚未明确——学习范式、行为数据和模型架构如何协调才能实现有效缩放?本文提出了一个协调三要素的缩放配方。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-16

本文提出一种两阶段混合神经-物理框架,利用RTS平滑器交替进行状态推断与神经网络参数更新,从部分观测数据中学习未知的ODE组件,同时在保持可解释性的前提下改善潜状态重建与长期预测。

常微分方程(ODE)广泛用于物理、生物、神经科学和生理学中的动力系统建模,但许多实际应用中,部分动力学方程未知,且仅能测量一部分状态变量。传统的纯物理模型无法应对缺失动态,纯数据驱动模型又牺牲可解释性。本文试图在部分观测条件下,同时学习未知的ODE组件并准确重建潜状态。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-16

RoboTTT 首次将机器人策略的视觉运动上下文长度扩展至 8K 时间步(较现有技术高出三个数量级),在不增加推理延迟的前提下,实现了从人类视频演示的一次性上下文模仿、在线策略改进、扰动鲁棒性以及在多阶段长程任务上的显著性能提升。

当前机器人基础模型通常仅使用单步或短历史视觉运动上下文(如 1–8 时间步),这限制了模型对长程依赖和在线适应能力的捕捉。RoboTTT 提出将测试时训练(Test-Time Training)集成到视觉-语言-动作(VLA)策略中,使序列模型的循环状态由梯度下降更新的快速权重构成,从而将历史压缩为权重空间,并在推理时检索长上下文信息。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-16

以往针对预训练数据的投毒研究大多依赖维基百科等已建立的数据源,其规模与异质性无法代表真实预训练语料库,且忽视了投毒数据与数据筛选管道之间的相互作用。本研究探索了在更现实的网络规模下,是否可以通过现有网络内容注入机制(公共讨论界面)对预训练数据进行投毒。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-16

Plover 通过将任务计划外化为可检查、可修改的工件,使 GUI 自动化代理的运行更加透明、可控和可适应,用户可以在计划可见、干预局部化的前提下有效修复代理的失败行为。

真实世界中的 GUI 自动化面临动态布局、意外对话框和界面状态演变等挑战,导致自主代理容易偏离用户意图。现有基于视觉的多模态代理虽然通过直接操作截图和自然语言指令提高了灵活性,但其规划与适应过程往往内部化(internal),用户无法检查、监督或纠正系统行为。Plover 针对这一问题提出以计划为中心(plan-centric)的交互方案。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-16

LLM在上下文学习中的概率估计严重违反全概率公式所要求的自一致性,但细粒度子群体估计反而比直接总体估计更准确(“宏观谬误”),表明模型拥有子群体知识但无法可靠聚合。

研究问题:LLM在上下文学习(ICL)中是否遵循统计自一致性——即当提示指定子群体时,模型输出的条件概率估计是否满足全概率公式(先验加权后聚合回总体估计)? 以往ICL被解释为条件推断,但这一解释是否成立缺乏直接验证。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-16

该方法提出了一种将记忆更新频率与记忆应用频率解耦的在线神经时空记忆框架,在保持长期记忆能力的同时实现了实时动态新颖视图合成,并在动态人体运动和分钟级在线记忆场景上达到当前最优性能。

多视角流式视频中的在线新颖视图合成面临一个基本权衡:既要维护持久的长期记忆以重建暂时被遮挡的区域,又必须在严格实时约束下运行。测试时训练(TTT)虽然提供了强大的记忆机制,但标准模型要求每帧进行基于梯度的记忆更新以适应动态场景的变化,导致计算成本过高无法实时应用,且长上下文下容易出现不稳定。本研究提出将记忆更新与记忆应用的频率解耦,通过周期性记忆更新和每帧…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-16

将教师模型与其基础模型(未进行推理指令微调)的输出概率差定义为“delta信号”,并以此作为蒸馏奖励,能显著提升在线策略强化学习蒸馏的效果,使推理大模型在极短的后训练期内达到强性能。

在线策略蒸馏(On-policy distillation)是强化学习中替代奖励模型的一种后训练方法,通过教师模型提供 token 级监督来缓解奖励模型带来的约束。然而,其基础设计(直接模仿教师输出分布)尚未被深入探索。本文提出一种新的蒸馏奖励——delta 信号,旨在更直接地传递推理能力。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-16

NeuronSoup 提出一种无需反向传播、不依赖可微计算图的神经计算架构,通过遗传算法协同演化网络的拓扑、权重、延迟和连接性,在 MNIST 分类任务上达到 85.9% 测试准确率,模型仅占 115 KB。

论文提出一种名为 NeuronSoup 的新型神经网络架构,核心是用异步、延迟介导的信号传播替代传统的逐层同步处理。网络由一组共享的神经元池构成,每条路径将连续值信号从输入神经元路由到输出神经元,经过可变数量的中间隐藏神经元。隐藏神经元被物理上共享:当两条路径经过同一个神经元时,后到达的信号会与先到达的累积状态相互作用,产生取决于信号极性和到达时间的建设性…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-16

心肌梗死(MI)是全球主要死因,超声心动图(Echo)是广泛使用的评估手段,其中区域室壁运动异常是关键指标。现有基于学习的运动分析方法依赖手工特征或密集监督,标注成本高;基础模型虽提升了单视图分析能力,但节段级定位在视图依赖歧义下(尤其是心尖视图)仍不可靠。本工作提出 MCF-Net 以解决多视图融合下的定位问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条