知识卡片:CAPEval——将图像描述质量解耦为覆盖度与精确度的评测基准
一句话结论
CAPEval 提出将图像描述(caption)质量拆分为“覆盖度”(Coverage)和“精确度”(Precision)两个维度,并通过受控下游实验发现:覆盖度更能预测多模态理解性能,而精确度更能预测文生图生成性能。
事件概述或研究问题
图像描述(caption)既是多模态理解任务的重要监督信号,也是文生图模型的关键输入。以往评测往往把描述质量当作单一标量指标,混淆了两个不同属性:
- 描述覆盖了多少图像中的视觉信息(Coverage);
- 描述所表达的陈述在多大程度上能被图像支持(Precision)。
CAPEval 正是为了解耦这两个属性而设计的评测基准。
方法/产品要点
- 基准名称:CAPEval(Coverage And Precision Evaluation)。
- 数据构建:使用人类书写的 ground-truth 描述,并包含人工核验的原子化检查清单(atomic checklist items)。
- 评价维度:
- Coverage:描述覆盖 ground-truth 事实内容的充分程度;
- Precision:描述中所有陈述的事实正确率。
- 实验设计:选取 10 个描述生成器(captioners),在 4 个模型家族中进行受控下游端到端实验,仅改变描述来源这一变量。
主要结果或产业意义
- 发现一致的“任务依赖式解耦”现象:
- Coverage 与理解性能的相关性更强;
- Precision 是生成性能的主导预测因子。
- 该评测范式能提供更细粒度的描述质量诊断。
- 可为不同下游任务选择或优化描述生成器提供可操作指导。
为什么重要
此前描述质量评测通常用一个总分衡量,容易掩盖“信息覆盖不足”和“陈述不可靠”之间的区别。CAPEval 将两者解耦后,给出了任务相关的明确结论:若目标是理解任务,应优先优化覆盖度;若目标是生成任务,应优先优化精确度。这为多模态模型的数据筛选、描述生成器选型和评测指标设计提供了新的思路。
局限与不确定性
- 材料为摘要层面信息,未提供具体数据集规模、评测协议细节、10 个 captioners 和 4 个模型家族的名单与具体实验数值。
- 未说明 CAPEval 在多大程度上适用于不同语言、不同领域或长描述场景。
- “覆盖度”和“精确度”的计算方式、人工核验一致性等细节待核实。
可用于图书/PPT/简报的角度
- 用一张图对比“单一总分评测”与“Coverage/Precision 解耦评测”的差异。
- 以 CAPEval 为例说明“评测指标的设计会影响模型选型和优化方向”。
- 展示“理解任务重覆盖、生成任务重精确”这一反直觉结论,作为多模态评测演进的案例。
与既有脉络的关系
本条卡片是对“多模态评测基准”方向的新增补充,与已有卡片中的 3D 理解/生成、知识图谱问答等方法类卡片不同,CAPEval 聚焦于“图像描述质量”本身的评测粒度,而不是某个具体模型架构或训练方法。
原始材料
- 英文标题:CAPEval: A Decoupled Caption Evaluation across Understanding and Generation
- 英文关键词:caption evaluation, coverage, precision, multimodal understanding, text-to-image generation, benchmark
- 来源:arXiv:2608.02589v1
- URL:https://arxiv.org/abs/2608.02589v1
- PDF:https://arxiv.org/pdf/2608.02589v1