AI消息速览

面向生物医学信息抽取的可配置语义分块框架

事件日期 2026-08-31 · 学术前沿 · 已接受

事件日期2026-08-31
信息日期2026-08-31
入库日期2026-09-01
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:面向生物医学信息抽取的可配置语义分块框架

英文标题:Configurable Semantic Chunking for Biomedical Information Extraction in Retrieval-Augmented Generation

英文关键词:retrieval-augmented generation; semantic chunking; biomedical information extraction; relation extraction; configurable framework

一句话结论:面向生物医学信息抽取,将检索增强生成(RAG)中的固定大小分块替换为可配置的语义分块,可在部分关系抽取任务上显著提升效果;但分块策略的优劣依任务类型而异,并非对所有数据集都更优。

事件概述或研究问题:BioMedRAG 将带有学习式分块评分器的检索增强生成引入生物医学信息抽取,但其依赖固定大小分块,可能割裂语义证据。本文提出一种可配置的语义分块框架,通过组合多种分块策略解决这一问题,并仅替换 BioMedRAG 中的分块构建阶段,保留嵌入模型、学习式分块评分器、生成器和评估协议。

方法/产品要点:该可配置语义分块框架整合了以下策略:

  • 实体保持窗口(entity-preserving windows)
  • 以触发词为中心的分块(trigger-centered chunking)
  • 命题优先抽取(proposition-first extraction)
  • 分层触发词优先级(tiered trigger prioritization)
  • 层级关系消解(hierarchical relation resolution)

框架将分块逻辑外部化到配置文件中,使分块策略可解释、可调整,便于适配不同生物医学 RAG 管线。

主要结果或产业意义:在 GM-CIHT 基准上,完整混合配置取得 82.6% 的 F1,相比固定大小分块基线的 74.2% F1 提升 8.4 个百分点(在论文实验设置下)。跨数据集分析显示,语义分块对具有显式关系线索的抽取数据集(如 GM-CIHT 和 DDI)更有利;而固定分块在 ChemProt 和 ADE 这类密集生化抽取或二分类任务上仍具有竞争力或更强表现。

为什么重要:该工作将 RAG 优化的视角从检索与生成层下沉到“分块”这一基础组件,指出分块策略本身会显著影响生物医学关系抽取效果。模块化替换 BioMedRAG 分块阶段,使其可以作为一种可插拔改进,同时配置化设计增强了可解释性和落地适配性。

与既有脉络的关系:已有相关卡片分别涉及多跳检索决策(DynaKRAG)、教育评测(Earthquaker-AI)和多模态检索生成(DualG-MRAG);本条不是上述卡片的直接延续,而是补充了 RAG 管线中更细粒度的“分块”环节,并聚焦生物医学信息抽取场景,属于组件级增量信息。

局限与不确定性:来源仅包含论文摘要。各分块策略的具体实现细节、DDI 上的具体提升幅度、ChemProt 和 ADE 的完整数值、消融实验、统计显著性以及计算开销等信息均待核实。GM-CIHT 上的提升幅度也需理解为“在该论文实验设置下”的结果。

可用于图书/PPT/简报的角度

  • 分块不是“切文本”这么简单:分块方式会影响 RAG 的证据完整性。
  • 固定大小分块 vs 语义分块:不同任务类型适合不同策略。
  • 模块化改进:只替换分块构建阶段,也可以带来 F1 提升。
  • 生物医学文本中的实体、触发词和命题关系,是设计语义分块的重要线索。
  • “配置化”是让 RAG 分块策略更可解释、更易落地的一种工程思路。

原始材料

  • 英文标题:Configurable Semantic Chunking for Biomedical Information Extraction in Retrieval-Augmented Generation
  • arXiv ID:2608.31139v1
  • 作者:Riya Ahuja, Tim Kacprowski, Roya Shiasi Sardoabi
  • 发布信息:2026-08-31
  • 分类:cs.CL, cs.IR
  • 摘要链接:https://arxiv.org/abs/2608.31139v1
  • PDF 链接:https://arxiv.org/pdf/2608.31139v1