AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 41-60 条,共 2259 条
第 3 / 113 页
事件日期 2026-09-03

SBS(Seeing Before Synthesizing)提出“先看后合成”的新范式:先用视觉语言模型(VLM)观察事件间隙的帧级内容,再在真正发生语义转换的位置合成辅助指导,从而在弱监督密集视频描述中同时提升事件定位与描述性能。

弱监督密集视频描述(Weakly-Supervised Dense Video Captioning)的任务是:仅凭每段未修剪视频对应的一组有序事件级字幕,定位并描述视频中的多个事件。近期方法会用大语言模型(LLM)合成“过渡字幕”来提供额外的视觉-语言对齐信号,但这些字幕缺乏视觉基础,并且被固定分配到每个事件间隙的固定位置和时长上。SBS 针对这一局限,…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-03

Scal3R 针对在线 3D 重建在长视频中因“固定首帧锚点”导致漂移累积、几何坍塌的问题,提出“多参考关键帧相对位姿查询”范式:冻结主干网络,仅加入约 1% 参数量的可学习 token,并配合在线位姿图优化与闭环来抑制长距离漂移。候选摘要称其在 KITTI 上相对在线基线平均 ATE 降低超过 60%,并在多个数据集上取得 SOTA;具体数值和实验细节待…

现有在线 3D 重建模型在长视频上表现不佳。候选摘要认为原因是:模型以固定第一帧为锚点回归后续位姿,长序列会使模型外推至训练分布之外,微小漂移不断累积,最终放大为显著的全局几何坍塌。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-03

本文提出首个针对一般和并发随机博弈(CSG)的鲁棒PAC学习框架:在转移不确定性下,算法要么返回一个社会福利最优的ε-近似纳什均衡,要么提供一个“不存在精确纳什均衡”的可靠证书;在最小可达性条件下,样本复杂度为多项式。

研究对象是带转移不确定性的一般和并发随机博弈(general-sum concurrent stochastic games)。论文要解决的核心问题包括: 在只知道轨迹样本且转移核不确定时,如何高效学习到有性能保证的近似均衡? 当精确纳什均衡可能不存在时,学习算法应如何给出形式化结论,而不是预先假设均衡一定存在?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-03

论文提出,大语言模型的同策略蒸馏(On-policy Distillation, OPD)在数据极端稀缺时依然有效:只用**一个训练查询(query)**,OPD 也能持续改善数百步,并恢复全量数据训练的大部分收益;其瓶颈主要不在训练数据量,而在于学生模型吸收监督的步骤效率低下。

已有 OPD 研究主要关注算法行为,例如学生自生成轨迹与教师密集 token 级监督的组合,但**训练数据在其中扮演的角色尚不清楚**。本文把数据推到“最小极限”,研究仅用一个 query 做 OPD 训练会产生什么结果,并用“状态覆盖率(state coverage)”解释背后的机制。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-03

经典神经算子改变了偏微分方程求解方式,但高效量子版本一直受制于计算开销与理论空白;本文提出面向 NISQ 时代的量子神经算子 QuanONet/TF-QuanONet,其密度矩阵隐式构造“二次特征框架”,在理论上得到 \(\mathcal{O}(p^2)\) 的算子表达性上界,绕过匹配经典模型的 \(\mathcal{O}(p)\) 线性容量限制,并在严格…

**背景**:经典神经算子(如 DeepONet、FNO 等)已在 PDE 求解中取得成功,但发展高效的量子神经算子仍面临处理开销大、理论基础不足等挑战。 **问题**:现有量子机器学习范式往往需要过多的量子比特或过深的电路,难以在近期含噪中等规模量子(NISQ)硬件上实现。 **本文工作**:提出 QuanONet,一个面向 NISQ 的量子神经算子。…

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-09-03

根据论文摘要,Puffin-World 提出一种统一多模态模型,将物理、几何和外观作为“原生3D世界状态”联合建模,并构建 Puffin-16M 数据集,以支持 3D 世界的物理理解、空间模拟、生成与重建;定量效果和实现细节尚未核对,待核实。

研究问题:如何让多模态模型在不依赖外部离线模块的条件下,同时拥有物理理解、空间模拟和 3D 世界生成/重建能力。论文提出“原生3D世界状态”框架,将物理(重力场和纬度)、几何(深度)、外观(图像)纳入统一的建模和生成过程。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-03

该论文提出“前瞻性编码(prospective coding)”这一输入侧修正:通过让深层连续时间循环网络中每一层的自下而上输入具有前瞻性,可以缓解时间整合导致的层间信号延迟与误差衰减;结合作者提出的递归正交滤波器(RQF),在多个模型和长序列任务上取得优于或匹配非前瞻对照的表现。

Prospective Coding Improves Learning in Deep Continuous-Time Recurrent Networks

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-03

Principia 提出一种与相机标定无关的物理关系一致性评测框架:当同一场景中两个物体遵守同一物理定律时,它们的运动应满足可预测的关系。用该基准评测六个当前最先进的视频生成模型,所有模型的得分均不超过 0.42,而它们在 VBench 上的得分都在 0.8 左右;视觉语言模型检测物理违例的准确率也大多接近随机水平。

绝对运动测量(如速度、加速度)在生成视频中依赖帧率、物体尺度与相机标定,而这些信息在生成视频中经常缺失或不明确。针对此,作者提出转向“关系一致性”:如果两个物体受相同物理定律支配,它们的运动之间存在与标定无关的必然关系。基于这种思想构建 **Principia** 基准,用于评测视频模型的牛顿力学推理能力。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-03

当前高质量生成式图像模型在遵循指令和生成画质上表现强大,但“身份保真”仍是独立短板;将主体身份表示为可复用的“持久身份层”,比仅靠输入上下文或逐主体训练参数更能在生成、编辑和修复中维持身份一致。

Persistent Identity Preservation in Generative Image Models: A Benchmark and Evaluation System

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-03

该论文用参数化图理论研究张量网络态(TNS)的表示简化与量子态层析问题:cutwidth、tree-cutwidth 等图结构参数可用于界定把 TNS 表示为矩阵积态(MPS)或树张量网络态(TTN)时的键维(bond dimension)开销,并给出“可实现设定”及更一般的“不可知设定”下学习 TNS 所需样本复杂度与计算复杂度的图相关上界。

这是 arXiv 上的理论预印本,属 quant-ph,兼涉 cs.DS 与 cs.LG。 参数化图理论此前已被用于分析张量网络模拟,如 Markov and Shi (2008);但它对张量网络表示与层析的含义还不够清楚。 论文提出两个具体问题: 1. 哪些图参数决定一个张量网络态是否能被转化为可处理的 MPS 或 TTN 表示? 2. 哪些图参数控制学…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-03

Para-Pipe 提出了一种面向异构 SoC 的层级映射框架,通过在流水线架构内部与跨流水线阶段引入算子并行,试图同时优化吞吐量与延迟;具体实验数据可确认的是,在 Amlogic SoC 上吞吐量优化配置相比纯流水线策略平均能效提升 11.0%,相比非流水线并行执行提升 23.3%。(其余细节待核实)

本文研究边缘端深度学习应用在异构 SoC(如 CPU+GPU、DLA+DSP 等)上的性能优化问题。传统流水线方案虽能提升吞吐量,但难以满足现代神经网络复杂依赖关系和大量算子并行带来的延迟需求;而单纯强调并行执行又可能牺牲吞吐量。Para-Pipe 试图解决“流水线”与“并行执行”之间的折衷。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-03

EditVid 提出了一种无需训练的单一视频编辑框架,可同时支持指令引导与参考引导的多种编辑范式;在 FiVE 基准上达到 78.16 FiVE-Acc,远超所评估的最强免训练基线(58.95),用户研究中也以 51.8% 的整体偏好率胜过 7 个对比方法。

视频编辑存在多种不同范式,如何在同一个统一框架中实现高质量的指令引导和主体引导编辑,仍然具有挑战。 已有方法往往针对不同编辑类型采用不同管道,系统复杂且难以泛化。 EditVid 提出一种统一的免训练框架,让同一套机制可以处理风格迁移、属性修改、物体插入、局部编辑、主体替换等多种编辑任务。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-03

思维链推理轨迹的“可读性”(legibility)并不等于“可解释性”。论文将推理步骤的真实重要性操作化为 advantage(包含该步骤带来的期望奖励变化,如最终答对的概率变化),并用蒙特卡洛 rollout 进行估计。结果发现:LLM 评判员对高重要性步骤的判断虽然能超过流行率基线(prevalence baseline),但远低于噪声天花板(nois…

当前越来越多研究把思维链模型生成的推理文本当作“可读窗口”:用 LLM 评判员诊断模型错误、评估忠实性、为过程奖励模型(process reward model)和生成式评判器提供步骤级监督。这些实践隐含一个假设——推理步骤的文字表述承载了该步骤在其功能角色上的信息。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-03

该研究通过受控实验提出并验证:在大语言模型(LLM)预训练中,将同一知识以不同表述形式呈现的“辅助视图”(auxiliary views)对知识获取有因果性的帮助;在 token 预算固定的情况下,把原本用于文档重复的 token 分配给辅助视图,反而能提升学习效果,甚至包括事实性回忆。

研究者指出,关于大语言模型在预训练阶段如何获取知识,目前仍存在理解空白。他们提出一个假设:**辅助视图**(即对同一知识的重新表述/改写)是学习的因果促进因素,而非仅仅依赖原始文本的重复。为了验证这一点,他们设计了受控实验,试图把“重复”和“多样化表述”两种效应分离开来。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-03

该论文提出,在语言模型欺骗研究中需要区分“看起来欺骗性的输出”和“实际具有欺骗性的机制”;仅凭行为表现不能直接推断模型拥有欺骗机制,而即使存在机制证据,也不等于模型在欺骗中具有能动性(agency)。

论文指出,关于语言模型欺骗的研究和新闻报道越来越多地把类似人类的心理状态概念归于模型,这可能模糊“行为像欺骗”与“机制真的在欺骗”之间的界限。为此,作者引入了一个因果分类法,用于厘清多项容易混淆的概念,并通过实验检验这些区分。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-03

ESPO(Error-Structured Prompt Optimization)将提示词优化重构成“诊断错误模式—多样化生成—稳定化选择”三阶段。据候选摘要,它在 7 个公开 NLP benchmark 上将平均准确率从 GEPA 的 70.91% 提升到 74.67%(+3.76 个百分点),同时把提示词长度从约 1,878 字符降到 1,004 字…

进化式提示词优化器(如 GEPA)存在“提示词膨胀”问题:每一轮迭代都追加规则和注意事项,提示词最长可达原来的约 3 倍,但准确率没有继续提升(待核实)。 研究者将其归因于三个缺陷: 1. 错误观察不完整(incomplete error observation) 2. 搜索多样性有限(limited search diversity) 3. 选择机制不可…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-03

当无法获得客观正确答案(ground truth)时,可以用 **epistemic warrant**(认识论意义上的“依据/保证”)来刻画“某一条具体 LLM 推荐”是否值得依赖。摘要显示,该框架通过四层“依赖凭证”区分推荐的依据强弱,并且比单纯的模型置信度或决策难度提供更多信息。

LLM 越来越多地被用于支持组织决策,但用户往往缺乏原则性依据来判断:某一条具体推荐是否可以采纳。 现有方法通常评估模型整体属性,如可靠性、不确定性、鲁棒性,或关注用户信任;它们并未针对“单个推荐背后的可依赖基础”进行刻画。 本文从知识论(epistemology)中借鉴理论资源,提出决策层面的 **epistemic warrant**。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-03

论文提出“环境演化”(Environment Evolution)方法,在训练终端智能体时通过“off-policy”(离线/非当前策略)方式逐步提高任务环境难度,并按代调度演化后的环境,以持续提供有效学习信号;在 Terminal-Bench 2.1 上,经简单长程 RL 训练,Qwen3.6-27B 和 Qwen3.6-35B-A3B 的性能分别提升…

可交互、可验证的环境规模对训练终端智能体(terminal agents,如终端/命令行操作智能体)至关重要。但随着前沿模型能力增强,从零合成的新环境越来越不具备挑战性,能够提供的学习信号有限。现有“共同演化”(co-evolution)方法虽然能根据 rollout 中暴露的弱点迭代合成环境,但依赖当前策略的 on-policy rollouts,会在模…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-03

论文提出 TAHI(Test-Time Adaptation through Human-AI Interaction),利用跨会话的人机交互信号在测试阶段对智能体进行个性化适配,并通过一个不断演化的评估准则模块(evolving rubric module)把用户难以提前说清的标准显式化;在写作和视觉创作两个领域的 30 位用户、600 个任务上,仅用几…

AI 智能体通常基于大规模群体数据训练,具备覆盖许多从业者的通用能力,但其产出很难达到专业人士愿意为之背书的个人标准。在成功标准因人而异、且未充分文档化的开放式任务中,个人专长恰恰体现在对平均水平的超越与偏离。用户往往无法在开始时完整描述自己的评判标准,但在多轮迭代人机交互中会反复透露出这些标准。作者认为,这种跨会话交互数据是丰富但尚未被充分利用的信号,可…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条