AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1041-1060 条,共 2259 条
第 53 / 113 页
事件日期 2026-08-05

共享经典随机性——一种在纠缠理论中被视为较弱的资源——足以在固定浅层深度下,让信道量子生成模型严格表示比浅层酉 Born 模型更大的经典输出分布族;即使系统规模任意大,这种分离依然成立。

近期的量子硬件限制了电路深度,并通常施加几何局域连接,导致浅层酉 Born 模型可访问的输出分布受限。将随机性引入酉量子 Born 模型后得到的“信道模型”在经验上可提升生成性能,并且在小规模受限架构下已被证明能表示严格更大的分布族。然而,“固定浅层深度、任意大系统规模下,随机性是否能带来可证明的表示分离”此前仍是开放问题。本文给出肯定回答,并证明所需的随…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

程序化生成器可以规模化产出可验证推理问题,但“语义上有效”并不等于“对训练有用”。Reasoning Core 通过 50 个生成器、语义评分器、难度控制和审计流程,在 3B 规模的主要补全监督对比中,于 DROP、LogiQA、ARC-Challenge 上取得最高平均分,超过无程序化数据基线和三个替代程序化数据集合。

程序化生成器能够产生大量可验证的推理问题,但作为“补全监督微调”数据,受到的关注较少。Reasoning Core 研究的问题是:如何设计广泛的程序化数据,使其在补全监督推理训练中真正有效,而不仅仅是在规模上可行。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

MT-GNN 通过图网络预测皮层下结构表面的度量张量(第一基本形式)并解码为网格,在 ADNI 的 14 个皮层下结构上于所有预测视界均取得最优平均顶点误差,优于测地线形状回归(DCM)和网格 Transformer(TransforMesh)。

如何从已有的少数几次脑部扫描预测皮层下结构未来的形状演变,以支持神经退行性疾病的预后判断和临床试验受试者富集。现有纵向网格预测器要么通过高维嵌入外推形状轨迹,要么直接回归顶点变形;MT-GNN 则转向预测表面内在几何,并利用可微重建端到端训练。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

RAIL 将大语言模型后训练中的 rollout 生成/干预选择建模为在线上下文赌博机问题,通过学习“可恢复性控制器”动态决定如何干预,从而在有限 rollout 预算下持续提升策略学习效果。

无评论器(critic-free)、基于组(group-based)的强化学习已成为大语言模型后训练的可扩展方法。但大多数现有方法对每个任务和轨迹状态分配相同数量的 rollout,没有区分不同 rollout 的学习价值。近期的自适应 rollout 工作仍有两个局限:一是干预策略多基于固定启发式,无法随策略训练过程调整;二是通常只决定 rollout…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

OPD-V 提出将“模态平衡”本身作为特权信息,通过正/负教师构造模态平衡信任区域,筛选用于自蒸馏的同策略 token,在多模态大语言模型视觉推理后训练中一致提升性能并降低训练成本。

同策略自蒸馏(On-Policy Self-Distillation, OPSD)已成为提升多模态大语言模型(MLLM)视觉推理能力的常用后训练方法。现有方法从多种输入来源获取特权信息来指导自蒸馏,但普遍忽视了多模态推理中固有的“模态不平衡”问题:当文本信息主导生成时,模型无法充分整合视觉输入,导致精心设计的特权信息利用率不足。为研究这一限制,作者分别用“…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

在长上下文模型的继续训练语料中,仅用约 12% 的 OctoLong 跨仓库代码上下文替换传统上下文扩展语料,即可显著提升长程检索、长期状态跟踪、仓库级代码理解和下游智能体任务表现,同时增强短上下文编码场景中的 API 使用能力。

研究问题:现有长上下文语料以书籍、学术文章和代码仓库为主,这些语料是有限资源,且常常缺少长距离依赖关系。如何构造富含长距离依赖的长上下文训练语料? 核心思路:利用代码仓库内和跨仓库的引用/依赖关系,通过上下文工程手段生成“依赖密集”的百万级 token 代码上下文。 提出内容:论文提出 OctoLong,一个用于构造长上下文代码语料的上下文工程流水线;并基…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

本文提出一种名为 Audio-Visual Modal Sound Field(AV-MSF)的物体级声学表示,仅凭多视角图像和少量冲击声录音即可重建物体的冲击声场,并在真实数据集上取得优于物理仿真和数据驱动基线的渲染效果。

现代三维重建擅长建模物体的几何与外观,但忽略了物体被物理交互时发出的丰富声学线索。物体冲击声可以反映材料、刚度与结构属性,与视觉信息互补。然而,已有的冲击声建模方法要么依赖昂贵的物理仿真,要么需要大规模数据集进行纯数据驱动学习。作者因此提出一个新问题:能否用少量真实录音和视觉输入,重建物体级别的可编辑、可渲染冲击声场?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

MultiPathFormer 将无线信道建模从“信道张量上的掩码重建”转向“多径传播路径上的自回归预测”,以多径路径作为基础模型的预训练对象,在信道估计、波束预测、定位和视距分类等下游任务中超越基于信道张量的现有基础模型。

现有无线基础模型通常把信道张量(channel tensor)作为预训练输入,在子载波、天线或时间维度上做掩码重建,但忽略了无线传播的物理特性。本研究提出以**多径传播**作为预训练的基本对象,构建了一个自回归基础模型 MultiPathFormer,用于学习可复用的无线传播表征。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

据论文摘要,本研究提出一种基于潜空间视频流匹配(latent video flow-matching)的大气数据同化框架:用 ERA5 再分析数据训练时间连续的大气轨迹先验,再通过后验采样吸收真实稀疏观测,从而在一个框架内完成滤波、平滑,并直接从稀疏观测生成全状态集合预报,性能与最先进的“观测到预报”模型相当。

Multimodal Spatiotemporal Atmospheric Data Assimilation with Latent Flow-matching

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

MALT 在 Muon 优化器中引入轻量的双侧对角预条件子,以近似损失曲面的曲率几何,从而降低 Muon 对曲率各向异性的敏感性;在 GPT-2 Small、Medium、Large 预训练实验中,MALT 优于 Muon,同时保持几乎相同的内存占用和墙钟时间。

Muon 是近期出现的语言模型预训练优化器,它通过牛顿-舒尔茨迭代对动量矩阵进行正交化,缓解了梯度各向异性,但并未显式考虑损失曲面的曲率几何,因此可能仍对曲率各向异性敏感。本文提出 MALT,旨在以较低内存和计算开销弥补这一缺口,使优化器能够近似感知曲率。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

摘要未提供具体性能数值,整体结论待核实。SALT 的核心思路是:在自蒸馏预训练阶段,利用弱边界框标注定义一个空间区域,仅在该区域内锐化教师温度并提高掩码补丁损失权重,从而让冻结编码器在下游无需任何标签即可用于 CT 病灶检测。

现有自监督预训练目标在空间上是均匀的:教师温度和每个补丁的损失权重在图像各处完全相同,因此只有几个补丁大小的病灶对训练信号的贡献并不大于周围正常实质。已有工作偏向于把模型输入裁剪/导向到标注区域,这改变了模型“看到什么”,但并未在目标函数层面增加对病灶的建模压力。SALT 尝试直接对自蒸馏的目标进行空间自适应调节,使弱标注区域在预训练中获得更强监督信号,同…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

本文提出前缀最优生成策略(POGP),通过在学习扩散策略的去噪链上定义前缀值函数,让模型在测试时学会“何时停止”去噪:在四个 MuJoCo 连续控制任务上,相比 12 个基线,POGP 约减少 2.7 倍所需的去噪迭代次数,同时保持接近完整任务性能;与最先进的动态扩散基线相比,最终任务性能还提升约 3.5%。

扩散策略(Diffusion Policies)是连续控制中表达能力很强的策略类别,但迭代去噪过程带来明显计算瓶颈。不同动作样本的难度不同,如何依据动作难度自适应调整去噪步数,同时不损害任务表现,是本文要解决的核心问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

本研究提出IRIS框架,用神经科学启发的度量指标系统分析了视觉Transformer(ViT)中方向选择性(orientation selectivity)的涌现规律,发现训练范式是决定方向选择性强弱的最主要因素,且这些指标可为下游微调时解冻多少层提供机制性启发。

ViT已成为多种视觉任务中图像编码的事实标准,但由于缺乏局部归纳偏置,它以全局方式处理信息,其如何编码低层特征在机制上仍不清楚。相比之下,生物视觉系统通过初级视觉皮层(primary visual cortex)中局部感受野的整合,构建出方向选择性等低层通用表征。这引发了一个问题:这类根植于生物视觉的特征是否也会在ViT中涌现?本文系统研究了ViT中方向选…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

HiGram 提出一种进化的分层图记忆框架,通过路径级定位与协同重写,让 LLM 智能体在长期推理中能够更高效地检索和更新记忆,在提升答案质量的同时降低 token 消耗。

长期推理型 LLM 智能体需要一种能够随时间高效更新的记忆系统。现有图记忆方法虽然支持多跳检索与推理,但存在两个主要问题:一是所有记忆存储在平面图(flat graph)中,历史记忆累积后容易引入不相关上下文,增加证据选择的成本;二是记忆单元通常被独立更新,需要反复进行逐单元重写才能覆盖相互关联的变化。为此,HiGram 设计了分层图记忆与路径级重写机制。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

HexMIL是一种无需像素级标注的医学CT深度伪造检测方法,仅凭体级别标签训练,通过分层注意力机制同时实现跨未见生成器的稳健检测和对篡改区域的定位,且解释是“事前”(ante-hoc)而非“事后”(post-hoc)。

生成式模型可恶意篡改医学影像,构成“医学深度伪造”(medical deepfakes)威胁,可能干扰临床工作流。现有检测器主要有两个局限:对未见过的生成架构泛化能力差;缺乏可解释性。HexMIL旨在同时解决这两个问题,且训练时只需二分类的体级标签,不需要像素/区域级标注。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

该研究提出一个将大语言模型嵌入迭代式符号回归的框架 DASyR-LLM,让 LLM 在每一轮对候选动力学模型进行物理化学定性批评并提出新候选式,从而显著减少找到真实动力学模型所需的迭代次数,同时保持同等预测精度。

DASyR-LLM: Domain-Aware Symbolic Regression with LLMs for Kinetic Model Discovery

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

CoPlan 提出一种让人类照护规划者与多个 AI 智能体协同工作的照护规划界面;AI 生成候选干预措施及支持/质疑论点,人类可在最终方案生成前接受、拒绝、修改或增补论点,从而把 AI 推荐从“固定输出”变为“可检查、可质疑、可修订”。

该论文于 2026-08-05 在 arXiv 上发布(v1)。AI 辅助照护规划可以帮助临床医生、患者、照护者与照护团队协调复杂的决策,涉及临床、功能、社会心理和环境需求。但现有许多 AI 系统把推荐结果当作固定输出,用户难以在 AI 推荐与临床判断、患者价值观或现实可行性冲突时进行检查、质疑和修改。CoPlan 正是针对这一“人类对 AI 推荐失去控制…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

CoCo-IR 提出一种新的多轮“上下文组合式图像检索”任务,让用户通过多轮交互逐步细化检索结果。论文基于大型多模态模型(LMM)构建上下文感知检索器,生成随轮次演化的 Transformable Image Embeddings(TIE),并配合全自动数据引擎;摘要报告在 CIRCO 单轮基准上达到 39.4 mAP@5,在新建 CoCo-IR 基准的…

现有基于指令的图像检索系统能力虽强,但通常只支持单轮交互,无法捕捉真实世界复杂视觉搜索中的迭代过程。 论文提出 Contextual Composed Image Retrieval(CoCo-IR)任务:系统需要理解完整交互历史,根据每一轮的新指令或反馈逐步更新检索结果。 对应模型需要同时处理多轮上下文,而不是只处理单次查询。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

本文提出一种名为 Chained Recursive Language Models(Chained RLM)的推理时架构:让同一个大语言模型以“新鲜推理根”的形式被反复调用,通过传递紧凑摘要、黑板和工作区工件,把长上下文推理拆解为多个可检查、可修正的阶段,旨在缓解单次推理中早期错误传播的问题。

Chained Recursive Language Models for Multi-Iteration Reasoning

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

只按有限视界内的信息收益来选择实验的规划器,在“必须先构造能力、之后才能做有效实验”的任务上会结构性失效;本文提出 CG-Plan,用“能力感知的到目标成本启发式 h = h_cap + h_exp”来缓解这一问题。

自动化科学发现系统需要反复决定:做哪个实验、检验哪个假说、构建哪个工具、何时停止。许多系统用近视评分来做这些决定,例如“单位成本的期望信息增益”或“学习到的可信度评分”。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条