知识卡片:ExtractBench——面向企业文档的最全面数据提取基准
一句话结论
ExtractBench 是一个覆盖 370 份真实企业文档、4,869 页、8 个业务领域、67 种文档类型的开源文档提取基准;在该基准上,LlamaIndex 新推出的 LlamaExtract Agentic Plus 以 95.6% 的总体 value F1 和 8.1 美分/页的成本位列第一。
事件概述或研究问题
- 研究问题:企业智能体正越来越多地基于非结构化文档中的关键业务数据运行,当人类不再逐条校对时,文档提取系统需要在生产级场景下被可靠评估。
- 现存基准的不足:第一代基准(如 SROIE、DocILE、RealKIE)只评测固定字段恢复,无法评估系统面对未见过的 schema 的能力;新一代 schema-guided 基准虽支持推理时新 schema,但覆盖面窄,且均未评估视觉定位(visual grounding)、未包含扫描件/手写页,也未报告单位成本。
- ExtractBench 的定位:用“生产级”方式评测提取,同时覆盖准确性、完整性、可追溯性(grounding)和成本。
方法/产品要点
- 语料构成:370 份真实企业文档(4,869 页),覆盖 SEC 文件、基金持仓表、政府采购与海关表格、医疗报销单、汽车估值、破产文件、能源行业监管表格等。
- 五轴标注体系:
- Task challenge(任务难度):长列表完整性、大海捞针、密集文档
- Perception(感知):数字原生、扫描、手写、旋转
- Table structure(表格结构):合并表头、跨页表格、超大表格、单元格内表格等
- Document length(文档长度):短、中、长
- Business domain(业务领域):8 个领域、67 种文档类型
- Ground truth 构建三条管线:
- 真实文档:不同模型家族对同一 schema 提取,一致值成为候选答案,分歧处人工裁决;
- 合成长列表:数据优先构建,渲染 PDF 前已知每个值和 box,可精确评估数千行完整性;
- 表格类表单:169 份监管/税务表单,人工逐字段检查,并为 84% 的字段标注边界框。
- 评估对象:14 个系统,包括前沿 VLM(通过 structured-output API)、编码智能体(沙箱+本地工具)、专用提取 API(含 LlamaExtract 的 Cost-Effective、Agentic、Agentic Plus 三种模式)。
主要结果或产业意义
- 总体榜首:LlamaExtract Agentic Plus,95.6% value F1,8.1 美分/页;其 grounding 得分在两个层级均为最佳。
- 分长度表现:
- ≤10 页(72 篇文档):8/14 系统超过 90%,榜面平坦,主要差异在价格。
- 11–50 页(70 篇文档):Agentic Plus 93.3%;商业 VLM 普遍下滑。
- 超长文档(含最多 26,725 行的重复记录):所有商业 VLM 的召回率低于 35%,但精确率仍高,说明“返回的值对,但大部分文档内容没有返回”;Agentic Plus 保持 94.4%。
- 编码智能体的感知短板:两个前沿编码智能体(Codex 和 Claude Code)失败方向相反——一个擅长扫描/手写但旋转页面差,另一个相反;Agentic Plus 在三种感知挑战上均高于 93%。
- Grounding 仍是开放问题:VLM 和编码智能体默认不返回证据,因此两个 grounding 层级得分为零;在返回框的系统中,Agentic Plus 领先。
- 成本与质量关系:价格不预测准确性;准确率最高的系统单价不到最接近同类竞品的三分之一。LlamaExtract Cost-Effective 以 1.0 美分/页达到 86.8%,与 Claude Code 接近(87.1%)而成本为其约 1/16。
- 开源可复现:数据集(HuggingFace)、代码与评估工具(GitHub)、论文(arXiv)均已公开,schema 冻结,支持第三方自测。
为什么重要
- 这是目前公开材料中覆盖维度最广的企业文档提取基准之一,首次在同一个基准上联合评估长记录完整性、真实扫描/手写、词级与页级 grounding,以及实测成本。
- 与已有相关卡片(如 ParseBench)不同,ExtractBench 提供了更细粒度的问题轴标签和明确的成本/质量权衡视角,并引入了“Agentic Plus”这一产品层级。对于企业选型,它直接给出“每美分能买到多少准确度”的可比数据。
- 它把 grounding(值级边界框)作为核心评测维度,为后续改进提供了基线。
局限与不确定性
- 基准由 LlamaIndex 发布并包含自家产品 LlamaExtract 参与评测,存在利益相关,需独立复现验证(待核实是否存在第三方独立审计)。
- 具体系统名单、价格和使用模式可能随时间变化,文中数据仅反映发布时点(2026-08-11)。
- “最全面”是作者描述,是否“最全面”取决于比较范围;材料未与所有现存基准逐一对比。
- 编码智能体的具体配置、VLM 的具体调用参数未在摘要中完整披露(待核实)。
- 手写、扫描、旋转等感知挑战的具体通过率仅给出 93% 以上的聚合值,未逐项列出全部系统数据。
可用于图书/PPT/简报的角度
- 用一张“质量 vs 成本”散点图说明:最贵的系统不是最准的,预算有限时如何选择。
- 以“100 页文件 vs 前 10 页”对比展示长文档提取的“假召回”陷阱。
- 用“8 个系统短文档 >90%,长文档商业 VLM 全部 <35%”说明基准设计对评测结论的影响。
- 引出“grounding(证据定位)”作为下一代文档提取的关键竞争点。
与既有脉络的关系
- 在 ParseBench(AI 代理文档解析基准)基础上,ExtractBench 进一步覆盖企业提取场景,新增成本维度、感知挑战(扫描/手写/旋转)和 grounding 评分,并提供 LlamaExtract Agentic Plus 这一新产品的首发成绩。
原始材料
- 英文标题:ExtractBench: The Most Comprehensive Extraction Benchmark
- 原文链接:https://www.llamaindex.ai/blog/introducing-extractbench
- 英文关键词:ExtractBench; Document Extraction Benchmark; Enterprise Documents; Agentic Plus; LlamaExtract; Grounding; Value F1; Cost per Page
- 来源:LlamaIndex Blog, Aug 11, 2026。数据集:HuggingFace;代码:GitHub;论文:arXiv。