AI消息速览

视觉工具使用的幻觉:对“用图像思考”的因果审计

事件日期 2026-08-06 · 学术前沿 · 已接受

事件日期2026-08-06
信息日期2026-08-06
入库日期2026-08-08
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:视觉工具使用的幻觉:对“用图像思考”的因果审计

一句话结论

“用图像思考”让多模态大模型调用裁剪/缩放等视觉工具来“看图”,但因果审计发现:即使聚合准确率有提升,视觉工具使用在大范围 rollout 中并不因果有效;提升集中在少数校准良好的轨迹上,因此存在“视觉工具使用的幻觉”。

英文关键词

Visual Tool-Use; Causal Audit; Thinking with Images; Multimodal LLMs; Visual Evidence Gain

事件概述或研究问题

  • 研究问题:模型调用视觉工具后返回的观测证据,是否真的因果地影响了最终答案?
  • 背景:已有“thinking-with-images”模型使用工具后,相对直接推理往往只有边际甚至负收益,而 token 成本高得多;模型还可能反复裁剪无关区域,并在直接推理能答对的问题上失败。

方法/产品要点

  • 将视觉工具使用建模为因果图,区分观测中介路径和动作诱导的捷径。
  • 在三个层面做干预审计:
    • 策略级:比较工具使用与直接推理;
    • 轨迹级:在 rollout 中破坏/corrupt 所有观测;
    • 步骤级:在固定前缀下反事实替换单次观测。
  • 步骤级估计量:Visual Evidence Gain(视觉证据增益),用于隔离每条返回观测的贡献。
  • 审计范围:6 个代表性多模态模型、5 个细粒度感知基准(具体名单原文摘要未列出,待核实)。

主要结果或产业意义

  • 发现策略校准不当的两种失败模式:
    • Calling Without Looking:返回的观测对答案没有因果效应;
    • Looking Without Planning:观测本身有信息量,但调用计划不连贯。
  • 轨迹级诊断显示:策略级准确率增益被少数“校准良好”的轨迹(Calibrated minority)所贡献,不能外推到大多数 rollout。
  • 作者将这种“聚合上有增益、因果上不有效”的差异称为“视觉工具使用的幻觉”。
  • 产业意义:部署视觉工具型多模态模型时,不能只看平均准确率;需要审计工具调用是否真正贡献答案,否则高 token 开销可能只是在购买“幻觉”。

为什么重要

  • 为“用图像思考”类方法提供了一种可复用的因果审计框架,超越单纯比较准确率。
  • 提出三层干预和 Visual Evidence Gain,能够定位是“调用不看”还是“看了不规划”。
  • 对工具使用型 Agent 的评估有启发:不仅要问“答得对不对”,还要问“中间观测是否因果地参与了作答”。

与既有脉络的关系

  • 与《OmniReasoner》的对照:OmniReasoner 主张通过原生工具使用(如 zoom-in)提升长音视频推理;本条则说明,这类工具使用的聚合准确率提升可能是一种“幻觉”,需要对中间观测做因果审计。增量信息:不能把后训练带来的平均收益直接归因于工具真正“看见”了证据。
  • 与《对拒绝的忠实性》的延续:两者都使用因果干预/审计来检验内部机制,但前者作用于神经元行/拒绝行为,后者作用于视觉工具调用的观测轨迹。增量信息:因果审计可以应用于 Agent 的中间动作,而不仅是模型内部表示。

局限与不确定性

  • 摘要未给出 6 个模型、5 个基准的具体名称,也未给出准确率和 token 成本的具体数值;待核实。
  • 三层干预的具体实现、被审计工具的类型、模型参数规模等细节需查原文;待核实。
  • “Calibrated minority”的具体比例、收益幅度,以及失败模式分布未知;待核实。
  • 发布形式为 arXiv 预印本;是否经同行评审/后续版本更新情况,待核实。

可用于图书/PPT/简报的角度

  • 指出“平均分提升”不等于“模型真的在依据证据思考”,可用“幻觉”反差制造记忆点。
  • 两种失败模式“Calling Without Looking”与“Looking Without Planning”适合做可视化对比。
  • 可以提出审计问题:多花的 token 是在购买证据,还是在购买“看似思考”的轨迹?
  • 可结合工具使用/Agent 评估:除结果指标外,还需对中间动作做因果干预。

原始材料

  • 英文标题:The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images
  • arXiv ID:2608.06270v1
  • 作者:Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu
  • 时间:Published/Updated 2026-08-06T17:01:08Z
  • 分类:cs.AI
  • URL:https://arxiv.org/abs/2608.06270v1
  • PDF:https://arxiv.org/pdf/2608.06270v1
  • 代码:https://github.com/OpenCausaLab/CauAudit