知识卡片:HierDoc:面向长文档视觉问答的分层页到区域证据路由
英文标题:HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering
英文关键词:Long-Document VQA; Evidence Routing; Page-to-Region; Hierarchical Selection; GRPO
一句话结论
HierDoc 将多页文档视觉问答中的证据获取建模为“先选页、再从页内选语义区域”的两阶段集合预测,通过在页面与区域两个粒度上分别优化策略,显著优于仅选页面的系统。
事件概述 / 研究问题
多页文档视觉问答需要在页面和区域两级定位稀疏证据。现有方法要么偏重页面选择(区域操作仅作导航),要么假设相关页面已给定而偏重区域选择,导致两个粒度脱节。HierDoc 提出将二者统一为连续的两阶段证据决策。
方法/产品要点
- 页面策略从完整文档中选择证据页面。
- 对已选页面解析语义元素,区域策略选择交由下游答案模型的元素。
- 两个策略均不依赖答案(answer-agnostic),采用阶段式 GRPO 与粒度特定的结构化集合奖励优化。
- 答案模型同时接收选中的完整页面、区域裁剪以及 OCR/表格文本,保留全局上下文并突出细粒度证据。
主要结果或产业意义
- 在评估基准上,HierDoc 在开源权重系统中达到最优或具有竞争力的表现。
- 在 LongDocURL 上,相对已报告的最强开源基线提升 16.87%。
- 消融实验显示,选中区域证据使仅页面系统在准确率和 F1 上分别提升 5.51% 和 4.82%。
为什么重要
HierDoc 把粗粒度页面路由与细粒度区域路由作为统一证据获取流程中连续、独立优化的阶段,而不是让二者割裂,为多页长文档视觉问答提供了一个清晰的阶段性路由框架。
与既有脉络的关系
与已有“视觉文档理解中无需坐标或区域标签的证据归因”卡片相比,HierDoc 不强调用自然语言引用代替坐标框,而是关注页面与区域两个层级的证据路由;其区域策略基于语义元素选择,属于先选页再选区域的系统设计。
局限与不确定性
- 原文摘要未提供消融提升是绝对百分点还是相对百分比,需核实。
- 具体评估基准列表、模型参数、训练数据、区域解析方式等细节待核实。
- 原文未讨论失败案例或局限,待核实。
可用于图书/PPT/简报的角度
- 用“先找对页码,再看对段落”比喻层级证据路由。
- 展示两级路由分别优化、组合使用的优势。
- 说明多页文档问答中“页面级”与“区域级”证据不是非此即彼,而是接力决策。
原始材料
- 英文标题:HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering
- arXiv ID:2607.29638v1
- 作者:Rongjian Gu, Wengang Zhou, Junyu Xiong, Yonghui Wang, Bing Yin, Bei Wang, Houqiang Li
- 发布时间:2026-07-31
- 分类:cs.CV
- URL:https://arxiv.org/abs/2607.29638v1
- PDF:https://arxiv.org/pdf/2607.29638v1