AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1081-1100 条,共 2259 条
第 55 / 113 页
事件日期 2026-08-04

Video-DeepResearch(Video-DR)将多模态深度研究智能体从静态图像扩展到连续视频流,通过“解耦感知-探索”流程和“SFT + GRPO”两阶段训练,在自建 Video-DR-Bench 上达到 64.0% 的平均准确率,超越 Claude-4.5-Sonnet(59.0%)、Gemini 2.5 Pro(57.5%)和 GPT-5(5…

现有深度研究智能体多处理静态图像或文本,而连续视频流要求模型具备密集的时空定位能力,同时还要结合开放网络探索。 初步评估发现两个关键瓶颈: 1. **模态偏差(modality bias)**:智能体会绕过视觉工具,更倾向于使用文本搜索来回答问题。 2. **参数知识泄漏(parametric knowledge leakage)**:模型依赖内部记忆而非…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

UniWorld-Design 提出将图像生成从“扁平像素合成”重构为“结构化视觉合成”,以语义 RGBA 图层作为生成、理解和编辑的基本单元,让多模态生成模型具备“图层原生”的设计空间。

本文提出一个名为 UniWorld-Design 的框架,核心观点是:像素决定图像如何被渲染,而图层决定图像如何被创建、理解和编辑。该框架旨在让模型像人类设计师一样,通过图层而非原始像素来操作视觉内容,从而支持更灵活的结构化图像生成与编辑。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

TurnSight 是一种面向工具集成推理(TIR)的回合级事后自我蒸馏框架:它从智能体实际执行结果中反推监督信号,构造多个不同前瞻视野的事后视图,利用跨视野方向一致性筛选可靠信号,再在多个同源采样轨迹(sibling rollouts)间归一化,并用于自适应调制强化学习优势;在三个基准上验证了有效性。

工具集成推理让大语言模型通过迭代调用工具解决复杂任务,但长程任务中强化学习常依赖轨迹级监督,细粒度信用分配不足。 在策略自我蒸馏能提供更密集的信号,但现有方法通常从标准答案或检索技能中构造教师上下文,未必匹配智能体实际访问的状态。 进一步地,token 级监督难以体现工具交互的回合级结构。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

本文提出一种名为 Acceleration Matching(AM)的新算法,通过将插值问题提升到相空间并回归一个显式的条件加速度场,从而无需轨迹模拟或昂贵预处理即可生成与给定离散时间快照分布一致的平滑随机轨迹。

轨迹推断是许多科学领域中的基础问题:给定一系列在不同离散时间点观测到的、未配对的快照(unpaired snapshots),目标是生成能够最好地拟合并在时间上插值这些数据的平滑轨迹。已有算法存在计算负担:要么依赖预处理子程序来强制平滑性,要么依赖基于模拟的训练目标,二者都可能代价高昂。本文旨在克服这些局限,提出更高效的训练方法。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

本文(arXiv:2608.03921v1)提出一种推理期 Transformer 的新解释:大型语言模型并非“随机鹦鹉”,而是在推理过程中构建并应用由提示生成的参数化变换。作者将此计算形式命名为 SIDPP(Sequence-level Interactive Dynamic Parallel Processing),并认为动态处理的贡献随提示长度增加,…

这篇论文属于学术预印本,标题为 “The Transformer Revolution, Part 1: Dynamic Processing through Output- Weight Interconnections”。研究问题主要是:如何从机制层面理解 Transformer 在推理时的工作方式?针对“大型语言模型只是重复训练中学到的统计规律”的“…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

测试时扩展(test-time scaling)不应被简化为一个标量“预算”;不同推理算法在统计结构、计算记账和失败模式上存在本质差异。只有把评估对象视为整个推理系统,并按协议匹配地报告计算量与不确定性,才能实现跨研究的可比性与可复现性。

本文是一篇 arXiv 预印本,系统梳理和形式化了大语言模型中的“测试时扩展”现象。研究问题包括:如何统一理解单轨迹扩展、采样后聚合、搜索未完成部分状态等多样算法?如何评估这些推理系统?如何确保推理协议的可复现性?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

TACT 提出一种将教学策略分类学与学生行为分类学融入大语言模型(LLM)后训练流程的框架,通过“监督微调 + 分类对齐的 GRPO”训练出的 TACTutor,在策略平衡的 TACTBench 上相对骨干模型提升 20.30%,并在 50 名学习者盲评中获得最高总体平均评分。

LLM 越来越多地被用于英语作为第二语言(ESL)学习者的对话练习。但有效的 ESL 辅导不只是生成流畅回复,还需要根据学习者行为与对话情境选择适当的教学动作。已有的人类辅导研究提供了自适应支持原则,但这些原则往往任务特定,且未充分整合到基于 LLM 的 ESL 辅导训练与评估中。TACT 旨在构建一个“人类 grounded”的框架,用于对教学自适应的…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

string2string Studio 是一个开源、无需安装、默认在浏览器本地运行的字符串到字符串算法平台,覆盖 NLP、计算生物学和数字人文中的六类核心方法,并通过可视化“证据”让算法结果可检查、可调试、可比较。

该 arXiv 预印本介绍了一个名为 string2string Studio 的交互式浏览器内平台。摘要没有以“研究问题”的形式单独陈述,但平台要解决的核心需求是:在不同领域中,让字符串到字符串算法及其结果不仅可运行,而且可检查、可调试、可共享比较。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

本论文在预测与生成两种经典大语言模型范式下,分别证明了低深度量子电路与有界资源经典LLM架构之间存在无条件分离:某些可由低深度量子电路采样的分布或计算的函数,常数轮扩散语言模型或常数深度 decoder-only Transformer 在给定限制下无法完成。

研究问题:现代大语言模型主要基于两类经典架构——Transformer(预测)和扩散语言模型(生成);是否存在它们无法完成,但低深度量子计算可以完成的任务或分布? 核心事件:作者证明了两类“无条件分离”结果,不依赖尚未证明的经典复杂度假设。 论文标题:Separating quantum circuits from classical LLMs。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

本文提出 R-ItCUR 算法,在交叉集中采样(t-CCS)下,能够从含有稀疏任意大异常值的低管秩三阶张量观测中稳健补全,并在合成张量、心脏 MRI 数据和三维地震数据上验证了准确性与鲁棒性。

t-CCS 采样通过仅观测选定水平切片和侧向切片中的条目,桥接了逐条目采样与 t-CUR 切片采样。已有 t-CCS 补全方法通常假设观测数据无粗大污染。本文研究当部分 t-CCS 观测被稀疏、任意大的异常值污染时,如何鲁棒恢复一个三阶低管秩张量。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

ReflectRL 提出将专家模型在困难问题上的失败轨迹视为“黄金负轨迹”(Golden Negative Trajectories),先引导模型对这类轨迹进行反思式推理,再通过“反思到直接策略迁移”把推理能力转回直接推理,在 9 个基准、4 个大语言模型基座和 4 种 on-policy 训练方法上始终提升了推理性能,且额外开销很小。

On-policy 训练已成为提升大语言模型推理能力的常用后训练范式,并常借助更强专家模型产生的“黄金轨迹”作为监督信号。然而,当专家在更难的问题上失败时,现有轨迹引导方法会失去主要监督来源,这些失败轨迹通常被当作负样本直接丢弃。作者提出,这些失败轨迹并非无用,而是可以作为“有缺陷的轨迹”被反思,从而提供有价值的推理信号。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

根据候选摘要(论文正文未抓取),该工作提出一种基于扩散模型的图像修复(inpainting)流水线,将重叠指纹图像分离为多个分量指纹;在**两个公开数据集**上,重建出的分量指纹与配对指纹(mated counterparts)能以很高概率匹配。具体匹配概率值和数据集名称**待核实**。

重叠摩擦脊线纹路在犯罪现场潜指纹和活体采集场景中反复出现:前者会影响法医比对,后者可能因传感器上残留指纹而污染后续采集。 既有分离方法主要有两类:一类依赖基于规则的取向场补全,需要较强领域知识;另一类使用端到端深度神经网络,但未充分结合指纹领域特定知识。 该文将“从重叠指纹中分离出每个分量指纹”重新定义为图像修复(inpainting)任务,并用扩散模型分…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

PRISM 是一个可插拔的元工作流,用于系统构造和评估将多变量时间序列映射为多通道图像(TS2I)的表示方法;实验表明,设计良好的图像表示能匹配甚至超越 24 种时域基线,在 14 个数据集中的 10 个上取得最佳 VUS-PR。

时间序列异常检测(TSAD)支撑着预测性维护、金融和云计算等应用,但性能对表示选择很敏感,尤其在多变量场景中。虽然将时间序列转为图像在预测和分类中已有成功,但多变量高维序列应如何映射到多通道图像、以及视觉骨干网络能否在 TSAD 中匹敌时域基线,仍不清楚。PRISM 试图系统回答这一问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

PTC 通过“先感知、再锚定”的两阶段设计,在无需额外训练和外部模型的情况下,用视觉原型校准文本嵌入,显著提升无训练开放词汇语义分割的完整性与准确性。

开放词汇语义分割(OVSS)需要根据任意文本描述将图像划分为语义区域;无训练版本不学习额外参数。现有方法通常只改进视觉表征,却把编码通用类别概念的文本嵌入当作固定的分类参考,导致“通用类别概念”与“目标实例具体外观”之间存在语义鸿沟,从而产生不完整掩码和非目标区域误判。本文提出 Prototype-Guided Text Calibration(PTC)来…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

PAST-Bench 通过“保留经验开/关”的对照实验,系统检验个人智能体能否从已积累的经验中获得后续任务改进;结果发现改进真实但不均衡,相同总增益下路径证据可能不同;基于此提出的 Hermes+ 能提高平均增益并给出更清晰的路径证据,但效果仍依赖能力与模型。

递归自我改进要求智能体将积累的经验转化为未来更好的行为。个人 AI 智能体为此提供了具体场景,因为它们在会话之间保留偏好、任务历史、工具例程和学到的技能。然而,保留的经验是否真的能改善后续行为,此前没有被系统测试。PAST-Bench 正是为了隔离并回答这一问题而设计。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

ParVL 提出一种不直接扩大模型参数、也不增加顺序推理计算的多模态大模型缩放框架:通过复用现有 ViT 和 LLM 骨干参数、在多个视觉/语言分支上分配共享骨干的计算,从而在固定骨干参数预算下实现并行缩放,并系统研究视觉与语言模态之间的计算分配权衡。

现有 MLLM 缩放策略通常要么扩展模型参数,要么扩展顺序推理计算,会带来较大的内存或延迟开销;更重要的是,大多数方法无法改变 ViT 与 LLM 之间刚性固定的计算分配,难以针对具体任务进行优化。ParVL 提出的核心问题是:**在固定骨干参数预算下,额外的共享骨干计算应如何在视觉模态和语言模态之间分配?**

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

在 Mamba-2 130M 模型上的受控实验中,Muon 优化器的收益具有局部性:仅对输出投影使用 Muon 优于对输入投影或同时对两者使用;优势主要体现在 token 效率上,且条件数不能解释这一收益。

研究问题:Muon 是一种通过对每个权重矩阵的更新做正交化(Newton-Schulz 迭代)、在谱范数下执行最速下降的优化器,但既有证据几乎全部来自 Transformer 模型,其在状态空间模型(SSM)上的行为鲜有报告。 本文在 Mamba-2 130M 上对比 Muon 与 AdamW,采用控制变量协议:仅改变哪些权重组由 Muon 训练,其余设置…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

本文发现归一化仿射参数(如 BN 的 scale/shift)是决定量化鲁棒性的“低维高杠杆”子空间,提出 Normalization Affine Preconditioning (NAP) 方法,通过在量化图上只微调仿射参数(PTQ 场景)或交替进行特征学习与数值校准(QAT 场景),即可恢复严重崩溃的低比特量化精度,并超越饱和的全参数联合训练。

低比特量化在紧凑网络上精度严重下降,作者将其归因于主流的“全参数耦合训练”范式忽略了参数子空间的异质性。 紧凑网络的特征冗余有限,难以吸收量化误差。 传统 PTQ 只重建固定预训练模型,不改善模型本身的量化友好性;传统 QAT 联合更新全部参数,骨干权重与校准参数之间存在梯度耦合。 本文核心问题:是否存在一个低维子空间,能高效控制量化鲁棒性?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条