知识卡片:TraceViT:基于接地迹监督的视觉抽象推理
一句话结论
TraceViT 通过将循环视觉推理模型的中间迭代过程约束为“语义单调的变换链”,并配合任务参考与对象工作区接地,在 ARC-AGI-1 上达到 67.8% 的 pass@2,在 ARC-AGI-2 上达到 24.3%;受控消融表明,迹监督只有在与接地配对时才有益。
事件概述或研究问题
Abstraction and Reasoning Corpus(ARC)要求模型从少量输入-输出示例中推断未见的变换,并将其应用到新的网格上。循环视觉推理器会在多次迭代中逐步修正预测,但传统训练只约束最终输出,中间迭代的修正过程没有任何监督信号。本文提出:中间修正应当逐步跟随真实变换,而不是只检查终点是否正确。
方法/产品要点
- 模型:TraceViT,一个循环视觉推理器,训练时使用“语义单调变换链”作为迹监督。
- 变换链构造:通过改写并验证程序化任务实现,将每个解决方案分解为一系列中间网格状态,得到逐步单调逼近最终结果的变换链。
- 接地(Grounding):每次迭代都由两类信息接地:一是从 few-shot 演示中得到的任务参考,二是表示当前网格状态的对象工作区。
- 软迹对齐(Soft Trace Alignment):变换链长度可能与循环迭代次数不同,软对齐只强制变换链的顺序,不强制一一对应,从而允许模型自由分配迭代次数。
主要结果或产业意义
- ARC-AGI-1:pass@2 达到 67.8%。
- ARC-AGI-2:pass@2 达到 24.3%。
- ARC-AGI-1 上的受控消融显示:单纯的迹监督并不足够,只有与接地机制配对时才能带来收益。
- 代码和数据将公开:https://github.com/LiuBinnan/TraceViT
为什么重要
循环视觉推理模型长期缺乏对中间步骤的监督信号,TraceViT 提供了一种从程序化任务实现中自动构造中间状态迹的方法,使模型每一步迭代都有可学习的“过程标签”。与已有相关卡片相比,本条是视觉抽象推理领域的“迹监督”方法,不同于 AdaPrefix-GRPO 在数学推理中注入前缀迹的做法;也与 HDR 的多步视觉推理框架、ExpertVerse 的评估基准不同,TraceViT 直接解决了中间迭代监督缺失的问题。
局限与不确定性
- 变换链依赖对程序化任务实现的改写与验证,对于无法程序化表达的任务,该方法是否适用待核实。
- 软迹对齐的具体实现细节(如顺序损失函数形式)未在摘要中展开,待核实。
- ARC-AGI-2 上绝对准确率仍较低,说明任务难度依然很高。
- 消融研究的具体数值和设置未在摘要中给出,待核实。
可用于图书/PPT/简报的角度
- 用“过程监督 vs 结果监督”说明 TraceViT 的核心思想:不是只看最终答案对不对,而是要求每一轮“思考”都朝着正确方向走。
- 可作图对比传统循环推理与 TraceViT:传统模型只约束输出端,TraceViT 在中间状态上插入接地迹监督。
- 可与其他“迹”类方法(如迹前缀控制)一起组成“从过程监督到推理泛化”的主题讲解。
原始材料
- 英文标题:TraceViT: Grounded Trace Supervision for Visual Abstract Reasoning
- 英文关键词:TraceViT; Visual Abstract Reasoning; Abstraction and Reasoning Corpus; Trace Supervision; Looped Visual Reasoner
- 来源:https://arxiv.org/abs/2607.29586v1
- arXiv ID:2607.29586v1
- 作者:Binnan Liu, Yechi Ma, Tian Xie, Wei Hua
- 提交/更新时间:2026-07-31T16:09:44Z
- 分类:cs.CV, cs.AI