AI消息速览

GAMUT:基于双层元量规的长文本生成事实完整性基准

事件日期 2026-07-21 · 学术前沿 · 已接受

事件日期2026-07-21
信息日期2026-07-21
入库日期2026-07-22
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:GAMUT:基于双层元量规的长文本生成事实完整性基准

一句话结论:本文提出了GAMUT(Grounded Assessment of Multimodal Factuality),一个专门评估长文本生成中事实完整性(factual completeness)的基准,填补了传统仅关注事实精确性的评估空白。在14个前沿和开源模型上,最佳得分仅58.7%(Gemini 3.1 Pro),表明该基准极具挑战性。

事件概述/研究问题:当前长文本生成的事实性评估主要聚焦于精确性(precision),即模型生成的陈述是否正确。常用的“分解-搜索-验证”流程能有效捕捉错误陈述,但无法回答“回答是否包含了所有应包含的信息”这一关键问题。事实完整性是事实性的缺失一半,其难点在于:一个完整答案应包含的所有事实难以枚举,且这些事实往往不是简单的平铺列表,而是涉及开放集合(覆盖度重要)、有序过程以及事实间关系,简单的独立布尔检查无法捕获这些结构。

方法/产品要点

  • 提出双层元量规框架(Two-Level Meta-Rubrics):上层为结构化元量规(meta-rubric),捕获所需内容的组织结构和重要性;下层为机械编译后的扁平化检查清单(flat checklist),由二值、机器可评分的量规组成,供LLM评判器可靠评分。
  • 实例化为GAMUT基准:基于真实可穿戴设备图像构建了1,813个问题,覆盖10个不同领域,每个问题配有人工专家验证的、有证据支持的量规。
  • 框架与模态无关,同时发布纯文本变体。

主要结果或产业意义

  • 评测了14个前沿和开源模型,最佳得分58.7%(Gemini 3.1 Pro),表明当前模型在事实完整性上表现有限。
  • 基准具有高区分度(highly discriminative),且对评判器的选择具有鲁棒性(robust to the choice of judge)。
  • 首次系统性地量化了长文本生成在“包含所有应包含信息”方面的不足,为后续改进提供了明确方向。

为什么重要:现有评估体系侧重事实精确性,忽略完整性;GAMUT补全了事实性评估的另一半,尤其适用于需要全面、详尽回应的应用场景(如产品描述、技术文档、医疗建议等)。与既有脉络的关系:不同于已有卡片中聚焦定位、图像生成一致性或强化学习环境,本条卡片首次将“事实完整性”作为独立评估维度引入多模态长文本生成领域。

局限与不确定性:待核实。摘要未披露的问题包括:量规构建中专家一致性程度、不同模态下基准的泛化能力、LLM评判器在复杂结构上的评分误差、以及基准是否覆盖了所有类型的事实关系(如因果、条件等)。

可用于图书/PPT/简报的角度

  • 对比传统事实精确性评估与GAMUT完整性评估的差异,举例说明一个“正确但不完整”的回答的缺陷。
  • 展示双层元量规如何从结构化知识自动生成可执行的检查清单,可作为“可解释评估”的教学案例。
  • 以可穿戴设备领域的多模态问答为例,说明在真实场景中完整性比精确性更影响用户决策。

原始材料

  • URL: https://arxiv.org/abs/2607.19322v1
  • 英文标题: Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness
  • 英文关键词(待提取): foundation-model, open-ended generation, factual completeness, meta-rubric, LLM evaluation