知识卡片:从诊断到修正:真实世界表格解析的基准评测与改进
一句话结论
当前文档解析器在通用表格基准上得分很高,但在复杂真实世界表格上明显失效。本文提出诊断基准 TableParseMap 和无需重训练的修正框架 DEC,将冻结解析器的表格 TEDS 平均提升 1.57 点,在大型表格上提升达 5.66 点。
事件概述/研究问题
近期文档解析器在 OmniDocBench v1.6 上的表格 TEDS 得分已超过 93,但社区反馈和作者审计发现,这些解析器在复杂真实世界表格上仍持续失败。为量化这一差距,作者引入 TableParseMap:一个包含 916 个真实世界表格的诊断基准,覆盖 5 个挑战场景和 9 种失败类型。被评估的最强解析器在该基准上仅达到 85.03 TEDS,说明聚合基准分数掩盖了大量实质性弱点。
作者将失败归因于三方面互补的限制:
- 大型表格超出单次解析的可靠处理规模;
- 弱或模糊的视觉线索阻碍结构感知;
- 重建出的表格可能与图像在视觉上不一致。
方法/产品要点
作者提出 DEC(Decompose–Enhance–Correct,分解—增强—修正),一个由视觉一致性引导的智能体框架,可在不重训练的情况下改进冻结的表格解析器。DEC 使用通用视觉语言模型(VLM)作为控制器:
- Decompose(分解):沿结构感知边界切分大型表格;
- Enhance(增强):暴露弱视觉证据,并对变换后的视图重新解析;
- Correct(修正):诊断并修复残余错误。
DEC 还包含两个关键模块:
- VC-Gate(视觉一致性门控):选择性触发干预;
- VC-Ranker(视觉一致性排序器):在推理时无需真实 HTML 的情况下验证候选更新并支持回滚。
此外,作者通过离线指标和跨模型共识,从 4,556 个候选中导出了一个包含 1,977 个表格的 Consensus-Hard Set(共识困难集)。
主要结果或产业意义
- 在 TableParseMap 上,最强解析器仅达到 85.03 TEDS,与 OmniDocBench v1.6 上超过 93 的分数形成明显对比。
- 在三个冻结解析器上,DEC 平均提升 TEDS 1.57 点。
- 在 TableParseMap 上:
- 总体提升 1.89 点;
- 结构性错误场景提升 2.62 点;
- 大型表格场景提升 5.66 点。
产业意义在于:DEC 不要求重新训练解析器,可以直接增强现有系统在复杂真实文档上的表格解析稳定性,对文档智能化落地有实际价值。
为什么重要
已有相关卡片更多关注基准评测暴露的差距,例如 WorldExam 指出高视觉质量不保证世界模型具备内在反应性,DataGovBench 揭示真实世界数据分析的显著性能差距。本文的增量信息在于:它不仅用 TableParseMap 再次证明“聚合高分掩盖真实弱点”,还给出了一个“诊断—修正”闭环——通过视觉一致性引导的 DEC 框架,在推理阶段提升冻结解析器表现,而无需重新训练或依赖真实 HTML 标签。这为表格解析领域提供了一条从“发现问题”走向“解决问题”的路径。
局限与不确定性
- 本文为 arXiv 预印本,尚未验证同行评审情况。
- DEC 中具体使用的 VLM 型号、三个冻结解析器的名称、以及 VC-Gate/VC-Ranker 的网络结构和训练细节在摘要中未列出,待核实。
- Consensus-Hard Set 的构造标准和跨模型共识具体定义待核实。
- DEC 在不同解析器、不同表格类型上的更细粒度表现差异待核实。
- 摘要未提供 TableParseMap 中 9 种失败类型的具体名称和 5 个场景的详细划分,待核实。
可用于图书/PPT/简报的角度
- 案例:聚合基准分数高不等于真实场景可靠,可用“模拟考试高分、实际工作翻车”作类比。
- 方法创新点:不重新训练模型,而是用 VLM 做“控制器”来调度现有解析器,体现“智能体式修正”思路。
- 对文档 AI 产品设计的启示:视觉一致性可作为质量校验信号,在推理阶段自动触发修复,降低人工复核成本。
- 对评测体系构建的启示:需要专门设计困难集和诊断性分类,而不是只看平均分。
原始材料
- 英文标题:From Diagnosis to Correction: Benchmarking and Improving Real-World Table Parsing
- 英文关键词:Table Parsing; Benchmark; Visual Consistency; Agentic Framework; TEDS; Document AI
- 来源:arXiv:2608.09842v1 (cs.CV)
- URL:https://arxiv.org/abs/2608.09842v1