AI消息速览

CAPEval——将图像描述质量解耦为覆盖度与精确度的评测基准

事件日期 2026-08-03 · 学术前沿 · 已接受

事件日期2026-08-03
信息日期2026-08-03
入库日期2026-08-04
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:CAPEval——将图像描述质量解耦为覆盖度与精确度的评测基准

一句话结论

CAPEval 提出将图像描述(caption)质量拆分为“覆盖度”(Coverage)和“精确度”(Precision)两个维度,并通过受控下游实验发现:覆盖度更能预测多模态理解性能,而精确度更能预测文生图生成性能。

事件概述或研究问题

图像描述(caption)既是多模态理解任务的重要监督信号,也是文生图模型的关键输入。以往评测往往把描述质量当作单一标量指标,混淆了两个不同属性:

  1. 描述覆盖了多少图像中的视觉信息(Coverage);
  2. 描述所表达的陈述在多大程度上能被图像支持(Precision)。

CAPEval 正是为了解耦这两个属性而设计的评测基准。

方法/产品要点

  • 基准名称:CAPEval(Coverage And Precision Evaluation)。
  • 数据构建:使用人类书写的 ground-truth 描述,并包含人工核验的原子化检查清单(atomic checklist items)。
  • 评价维度:
    • Coverage:描述覆盖 ground-truth 事实内容的充分程度;
    • Precision:描述中所有陈述的事实正确率。
  • 实验设计:选取 10 个描述生成器(captioners),在 4 个模型家族中进行受控下游端到端实验,仅改变描述来源这一变量。

主要结果或产业意义

  • 发现一致的“任务依赖式解耦”现象:
    • Coverage 与理解性能的相关性更强;
    • Precision 是生成性能的主导预测因子。
  • 该评测范式能提供更细粒度的描述质量诊断。
  • 可为不同下游任务选择或优化描述生成器提供可操作指导。

为什么重要

此前描述质量评测通常用一个总分衡量,容易掩盖“信息覆盖不足”和“陈述不可靠”之间的区别。CAPEval 将两者解耦后,给出了任务相关的明确结论:若目标是理解任务,应优先优化覆盖度;若目标是生成任务,应优先优化精确度。这为多模态模型的数据筛选、描述生成器选型和评测指标设计提供了新的思路。

局限与不确定性

  • 材料为摘要层面信息,未提供具体数据集规模、评测协议细节、10 个 captioners 和 4 个模型家族的名单与具体实验数值。
  • 未说明 CAPEval 在多大程度上适用于不同语言、不同领域或长描述场景。
  • “覆盖度”和“精确度”的计算方式、人工核验一致性等细节待核实。

可用于图书/PPT/简报的角度

  • 用一张图对比“单一总分评测”与“Coverage/Precision 解耦评测”的差异。
  • 以 CAPEval 为例说明“评测指标的设计会影响模型选型和优化方向”。
  • 展示“理解任务重覆盖、生成任务重精确”这一反直觉结论,作为多模态评测演进的案例。

与既有脉络的关系

本条卡片是对“多模态评测基准”方向的新增补充,与已有卡片中的 3D 理解/生成、知识图谱问答等方法类卡片不同,CAPEval 聚焦于“图像描述质量”本身的评测粒度,而不是某个具体模型架构或训练方法。

原始材料

  • 英文标题:CAPEval: A Decoupled Caption Evaluation across Understanding and Generation
  • 英文关键词:caption evaluation, coverage, precision, multimodal understanding, text-to-image generation, benchmark
  • 来源:arXiv:2608.02589v1
  • URL:https://arxiv.org/abs/2608.02589v1
  • PDF:https://arxiv.org/pdf/2608.02589v1