知识卡片:视觉工具使用的幻觉:对“用图像思考”的因果审计
一句话结论
“用图像思考”让多模态大模型调用裁剪/缩放等视觉工具来“看图”,但因果审计发现:即使聚合准确率有提升,视觉工具使用在大范围 rollout 中并不因果有效;提升集中在少数校准良好的轨迹上,因此存在“视觉工具使用的幻觉”。
英文关键词
Visual Tool-Use; Causal Audit; Thinking with Images; Multimodal LLMs; Visual Evidence Gain
事件概述或研究问题
- 研究问题:模型调用视觉工具后返回的观测证据,是否真的因果地影响了最终答案?
- 背景:已有“thinking-with-images”模型使用工具后,相对直接推理往往只有边际甚至负收益,而 token 成本高得多;模型还可能反复裁剪无关区域,并在直接推理能答对的问题上失败。
方法/产品要点
- 将视觉工具使用建模为因果图,区分观测中介路径和动作诱导的捷径。
- 在三个层面做干预审计:
- 策略级:比较工具使用与直接推理;
- 轨迹级:在 rollout 中破坏/corrupt 所有观测;
- 步骤级:在固定前缀下反事实替换单次观测。
- 步骤级估计量:Visual Evidence Gain(视觉证据增益),用于隔离每条返回观测的贡献。
- 审计范围:6 个代表性多模态模型、5 个细粒度感知基准(具体名单原文摘要未列出,待核实)。
主要结果或产业意义
- 发现策略校准不当的两种失败模式:
- Calling Without Looking:返回的观测对答案没有因果效应;
- Looking Without Planning:观测本身有信息量,但调用计划不连贯。
- 轨迹级诊断显示:策略级准确率增益被少数“校准良好”的轨迹(Calibrated minority)所贡献,不能外推到大多数 rollout。
- 作者将这种“聚合上有增益、因果上不有效”的差异称为“视觉工具使用的幻觉”。
- 产业意义:部署视觉工具型多模态模型时,不能只看平均准确率;需要审计工具调用是否真正贡献答案,否则高 token 开销可能只是在购买“幻觉”。
为什么重要
- 为“用图像思考”类方法提供了一种可复用的因果审计框架,超越单纯比较准确率。
- 提出三层干预和 Visual Evidence Gain,能够定位是“调用不看”还是“看了不规划”。
- 对工具使用型 Agent 的评估有启发:不仅要问“答得对不对”,还要问“中间观测是否因果地参与了作答”。
与既有脉络的关系
- 与《OmniReasoner》的对照:OmniReasoner 主张通过原生工具使用(如 zoom-in)提升长音视频推理;本条则说明,这类工具使用的聚合准确率提升可能是一种“幻觉”,需要对中间观测做因果审计。增量信息:不能把后训练带来的平均收益直接归因于工具真正“看见”了证据。
- 与《对拒绝的忠实性》的延续:两者都使用因果干预/审计来检验内部机制,但前者作用于神经元行/拒绝行为,后者作用于视觉工具调用的观测轨迹。增量信息:因果审计可以应用于 Agent 的中间动作,而不仅是模型内部表示。
局限与不确定性
- 摘要未给出 6 个模型、5 个基准的具体名称,也未给出准确率和 token 成本的具体数值;待核实。
- 三层干预的具体实现、被审计工具的类型、模型参数规模等细节需查原文;待核实。
- “Calibrated minority”的具体比例、收益幅度,以及失败模式分布未知;待核实。
- 发布形式为 arXiv 预印本;是否经同行评审/后续版本更新情况,待核实。
可用于图书/PPT/简报的角度
- 指出“平均分提升”不等于“模型真的在依据证据思考”,可用“幻觉”反差制造记忆点。
- 两种失败模式“Calling Without Looking”与“Looking Without Planning”适合做可视化对比。
- 可以提出审计问题:多花的 token 是在购买证据,还是在购买“看似思考”的轨迹?
- 可结合工具使用/Agent 评估:除结果指标外,还需对中间动作做因果干预。
原始材料
- 英文标题:The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images
- arXiv ID:2608.06270v1
- 作者:Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu
- 时间:Published/Updated 2026-08-06T17:01:08Z
- 分类:cs.AI
- URL:https://arxiv.org/abs/2608.06270v1
- PDF:https://arxiv.org/pdf/2608.06270v1
- 代码:https://github.com/OpenCausaLab/CauAudit