AI消息速览

ExtractBench:面向模式引导的企业文档抽取基准

事件日期 2026-07-31 · 学术前沿 · 已接受

事件日期2026-07-31
信息日期2026-07-31
入库日期2026-08-03
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:ExtractBench:面向模式引导的企业文档抽取基准

一句话结论

ExtractBench 是目前已知首个同时评估“值准确率、大规模记录完整性、证据溯源性和实测成本”的 schema-guided extraction(模式引导抽取)基准;在该基准上,LlamaExtract Agentic Plus 在全部三项指标上排名第一,准确率与 coding agents 相当,但成本大幅更低。

事件概述或研究问题

企业工作流越来越多地依赖 agent 完成模式引导抽取:给定一份文档和用户自定义 schema,agent 需要忠实遵循 schema,生成正确输出,并附带源证据作为 grounding 元数据。但已有评测缺乏同时覆盖抽取准确性、记录完整性、grounding 和成本的标准。ExtractBench 提出并落地了这一评测框架。

方法/产品要点

  • 数据集规模:370 份企业文档、共 4,869 页,覆盖 8 个业务领域、67 种文档类型,并用标签区分不同挑战场景。
  • 可扩展的 schema 与 ground truth 构建流程
    • 真实文档:采用独立系统间一致性(independent-system agreement);
    • 合成列表:使用已知值;
    • 表单类文档:进行人工核验。
  • 评估指标
    • 值准确率:采用顺序无关的 value F1;
    • Grounding 溯源:词级(word-level)和页级(page-level)F1;
    • 同时记录实测成本(measured cost)。

主要结果或产业意义

  • 商业 VLM 在短文档上表现良好,但在长文档上经常截断记录列表。
  • Coding agents 准确率更高,但成本显著更高。
  • LlamaExtract Agentic Plus 在值准确率、grounding 和成本三项指标上综合排名第一,准确率接近 coding agents,而成本仅为后者的一小部分。
  • 数据集和评估代码已在 HuggingFace 和 GitHub 公开。

为什么重要

本卡片与已有相关卡片关注点不同:它不是提出新模型或新能力,而是为企业文档抽取 agent 提供评测基准,首次把“值准确率、记录完整性、grounding 和成本”放进同一把尺子,帮助实际选型和部署决策。增量信息在于:该基准揭示了商业 VLM 在长文档上的截断短板,以及 coding agents 与高效 agent 服务之间的准确率—成本权衡。

局限与不确定性

  • 摘要未给出具体 F1 数值和各方法详细对比,因此“排名第一”“成本更低”的具体幅度待核实。
  • 基准由开发 LlamaExtract 的团队提出,是否对自家产品存在偏向性,无法从本材料确认。
  • 数据集中的文档来源、领域分布细节以及 ground truth 构建的最终质量控制标准,待核实。

可用于图书/PPT/简报的角度

  • 企业 AI agent 的评估维度设计:准确率、完整性、可溯源性与成本缺一不可。
  • 长文档抽取的“截断”问题:说明简单扩大上下文窗口未必解决记录列表完整性。
  • VLM 与 coding agent 的成本/准确率取舍案例。
  • 如何构建大规模高质量 ground truth:独立系统一致 + 合成已知值 + 人工核验的组合方案。

原始材料

  • 英文标题:ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
  • 英文关键词:schema-guided extraction, enterprise document extraction, benchmark, grounding, value F1, record completeness, cost, VLMs, coding agents
  • 作者:Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon Suo
  • 发布/更新:2026-07-31
  • arXiv 类别:cs.AI
  • arXiv ID:2607.29677v1
  • URL:https://arxiv.org/abs/2607.29677v1
  • PDF:https://arxiv.org/pdf/2607.29677v1
  • 数据与代码:https://huggingface.co/datasets/llamaindex/ExtractBench ;https://github.com/run-llama/ExtractBench