AI消息速览

TraceViT:基于接地迹监督的视觉抽象推理

事件日期 2026-07-31 · 学术前沿 · 已接受

事件日期2026-07-31
信息日期2026-07-31
入库日期2026-08-04
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:TraceViT:基于接地迹监督的视觉抽象推理

一句话结论

TraceViT 通过将循环视觉推理模型的中间迭代过程约束为“语义单调的变换链”,并配合任务参考与对象工作区接地,在 ARC-AGI-1 上达到 67.8% 的 pass@2,在 ARC-AGI-2 上达到 24.3%;受控消融表明,迹监督只有在与接地配对时才有益。

事件概述或研究问题

Abstraction and Reasoning Corpus(ARC)要求模型从少量输入-输出示例中推断未见的变换,并将其应用到新的网格上。循环视觉推理器会在多次迭代中逐步修正预测,但传统训练只约束最终输出,中间迭代的修正过程没有任何监督信号。本文提出:中间修正应当逐步跟随真实变换,而不是只检查终点是否正确。

方法/产品要点

  • 模型:TraceViT,一个循环视觉推理器,训练时使用“语义单调变换链”作为迹监督。
  • 变换链构造:通过改写并验证程序化任务实现,将每个解决方案分解为一系列中间网格状态,得到逐步单调逼近最终结果的变换链。
  • 接地(Grounding):每次迭代都由两类信息接地:一是从 few-shot 演示中得到的任务参考,二是表示当前网格状态的对象工作区。
  • 软迹对齐(Soft Trace Alignment):变换链长度可能与循环迭代次数不同,软对齐只强制变换链的顺序,不强制一一对应,从而允许模型自由分配迭代次数。

主要结果或产业意义

  • ARC-AGI-1:pass@2 达到 67.8%。
  • ARC-AGI-2:pass@2 达到 24.3%。
  • ARC-AGI-1 上的受控消融显示:单纯的迹监督并不足够,只有与接地机制配对时才能带来收益。
  • 代码和数据将公开:https://github.com/LiuBinnan/TraceViT

为什么重要

循环视觉推理模型长期缺乏对中间步骤的监督信号,TraceViT 提供了一种从程序化任务实现中自动构造中间状态迹的方法,使模型每一步迭代都有可学习的“过程标签”。与已有相关卡片相比,本条是视觉抽象推理领域的“迹监督”方法,不同于 AdaPrefix-GRPO 在数学推理中注入前缀迹的做法;也与 HDR 的多步视觉推理框架、ExpertVerse 的评估基准不同,TraceViT 直接解决了中间迭代监督缺失的问题。

局限与不确定性

  • 变换链依赖对程序化任务实现的改写与验证,对于无法程序化表达的任务,该方法是否适用待核实。
  • 软迹对齐的具体实现细节(如顺序损失函数形式)未在摘要中展开,待核实。
  • ARC-AGI-2 上绝对准确率仍较低,说明任务难度依然很高。
  • 消融研究的具体数值和设置未在摘要中给出,待核实。

可用于图书/PPT/简报的角度

  • 用“过程监督 vs 结果监督”说明 TraceViT 的核心思想:不是只看最终答案对不对,而是要求每一轮“思考”都朝着正确方向走。
  • 可作图对比传统循环推理与 TraceViT:传统模型只约束输出端,TraceViT 在中间状态上插入接地迹监督。
  • 可与其他“迹”类方法(如迹前缀控制)一起组成“从过程监督到推理泛化”的主题讲解。

原始材料

  • 英文标题:TraceViT: Grounded Trace Supervision for Visual Abstract Reasoning
  • 英文关键词:TraceViT; Visual Abstract Reasoning; Abstraction and Reasoning Corpus; Trace Supervision; Looped Visual Reasoner
  • 来源:https://arxiv.org/abs/2607.29586v1
  • arXiv ID:2607.29586v1
  • 作者:Binnan Liu, Yechi Ma, Tian Xie, Wei Hua
  • 提交/更新时间:2026-07-31T16:09:44Z
  • 分类:cs.CV, cs.AI