知识卡片:主动观察者测试:多模态大语言模型缺乏主动视觉感知能力
一句话结论
当前最强的多模态大语言模型(MLLM)在需要主动、循环的视觉观察任务上大幅落后于人类(人类平均96.1%,最佳模型GPT-5.5仅10.6%,Claude Fable 5仅3.5%),表明这些模型缺乏鲁棒的主动视觉观察能力。
事件概述或研究问题
人类视觉是一个闭环过程:注视点会根据中间假设持续重定向,而非一次性快照。数十年的心理物理学和认知科学认为,这种主动观察对于广泛任务至关重要。然而,当前的多模态大语言模型(MLLM)是否具备主动观察能力?现有的视觉语言基准无法回答这一问题。本文提出了ActiveVision基准,以量化MLLM的主动观察能力。
方法/产品要点
- 提出ActiveVision基准,包含17项任务,分为3个类别。
- 任务设计迫使模型进行重复的视觉感知,而非单一的静态描述。
- 评估了多个前沿MLLM,包括GPT-5.5(最高暴露推理努力层级)和Claude Fable 5。
- 此外,还测试了模型编写并运行自己的视觉代码的情况。
主要结果或产业意义
- 最佳模型GPT-5.5仅解决10.6%的项目,在17项任务中有11项得分为零。
- Claude Fable 5仅解决3.5%的任务,尽管它在大多数推理和编程排行榜上名列前茅。
- 三名人类参与者平均得分96.1%,远超所有模型。
- 即使模型编写并运行自己的视觉代码,仍存在巨大差距:此类代码在真实图像上不可靠,而捕捉其失败本身就需要模型缺乏的主动感知能力。
- 结果表明当前MLLM缺乏鲁棒的主动视觉观察,这为闭环感知-推理的架构和训练目标提供了动机。
为什么重要
- 首次系统性地衡量MLLM的主动视觉观察能力,填补了现有基准的空白。
- 揭示了即使是顶尖模型在需要动态迭代视觉信息的任务上的系统性失败。
- 对于开发更接近人类视觉的AI系统具有指导意义。
局限与不确定性
- 仅评估了有限数量的模型,更多模型的表现待核实。
- 任务类别和具体设计细节待从全文中确认。
- 人类受试者仅三人,样本量较小。
- 主动视觉观察的定义可能因任务而异,基准的泛化性待核实。
可用于图书/PPT/简报的角度
- 比较人类与AI在主动视觉任务上的巨大差异,展示当前AI的核心短板。
- 强调“感知-推理闭环”作为未来AI架构的关键方向。
- 引用该基准可作为评估下一代MLLM的标准之一。
原始材料
- 英文标题: An Exam for Active Observers
- 英文关键词: active observation, multimodal large language models, vision-language benchmark, closed-loop perception
- 来源: arXiv:2607.16165v1 (cs.CV, cs.AI, cs.CL, cs.LG), 发布于2026-07-17
- 作者: Jiarui Zhang, Muzi Tao, Shangshang Wang, Ollie Liu, Xuezhe Ma, Willie Neiswanger
- URL: https://arxiv.org/abs/2607.16165v1