知识卡片:HoloCount:面向多模态大语言模型的整体视觉计数基准
英文标题:HoloCount: A Holistic Visual Counting Benchmark for MLLMs
英文关键词:HoloCount, visual counting benchmark, MLLMs, numerical hallucination, multimodal intelligence
一句话结论
HoloCount 是一个分级诊断性视觉计数基准,揭示了当前多模态大语言模型在从感知性计数过渡到复杂逻辑推理与对抗场景时性能显著下降,定量的精确性仍是重大瓶颈。
事件概述或研究问题
多模态大语言模型在定性场景理解上取得了显著成功,但在定量精度上存在持续的数字幻觉。现有计数基准多集中于简化语境下的基础感知,未能捕捉逻辑约束或对抗条件下出现的复杂失效模式。为此,本文提出了 HoloCount——一个基于三级层次分类法的整体性、诊断丰富的基准。
方法/产品要点
- 三级分类体系:
- 语义计数:聚焦原子实体和基于属性的枚举。
- 分析计数:通过空间和集合推理评估逻辑组合能力。
- 鲁棒性测试:探测模型在高密度场景、语言偏见等对抗场景与有依据的先验下的完整性。
- 数据集已公开,访问地址:https://mm-mvr.github.io/HoloCount/
主要结果或产业意义
对超过20个最先进多模态大语言模型的全面评估显示:即使是顶级模型,当任务从感知逐步转向复杂分析推理和对抗场景时,性能也显著退化。该基准为系统化评估模型计数能力提供了蓝图,有助于开发更可靠的多模态系统。
为什么重要
视觉计数是多模态智能的基本支柱,要求精细定位与空间推理的无缝整合。HoloCount 首次系统性地覆盖了语义、分析和鲁棒性三个层次,暴露了现有模型在定量推理上的根本弱点,为后续研究指明了方向。
局限与不确定性
原始材料未提及具体局限性,以下内容待核实:
- 基准场景的类别均衡性、标签质量、规模等因素未在摘要中说明。
- 是否覆盖视频或动态计数场景未知。
- 基准的跨领域泛化性(如医学图像、遥感图像)尚未评估。
可用于图书/PPT/简报的角度
- 用“数字幻觉”现象切入,展示MLLM计数失败案例。
- 对比Holocount三级任务与现有基准(如CountBench等)的覆盖范围差异。
- 强调“从感知到推理”的难度跃升,作为多模态智能发展路径的典型案例。
原始材料
- 论文标题:HoloCount: A Holistic Visual Counting Benchmark for MLLMs
- arXiv ID:2607.06420v1
- 摘要链接:https://arxiv.org/abs/2607.06420v1
- PDF链接:https://arxiv.org/pdf/2607.06420v1
- 数据集主页:https://mm-mvr.github.io/HoloCount/
- 作者:Jinhong Deng, Limeng Qiao, Guanglu Wan
- 发布时间:2026-07-07