AI消息速览

让非结构化数据在智能体推理中自适应结构化

事件日期 2026-08-31 · 学术前沿 · 已接受

事件日期2026-08-31
信息日期2026-08-31
入库日期2026-09-02
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:让非结构化数据在智能体推理中自适应结构化

英文标题:Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data
英文关键词(依据摘要提炼):agentic data cracking; adaptive structuring; unstructured data; LLM agents; token efficiency; data infrastructure
原始来源:https://arxiv.org/abs/2608.31082v1

一句话结论

面对网页、报告、合同、PDF 等非结构化数据,LLM 智能体虽然能完成复杂问答,但单次可能消耗上百万 token。本文提出 agentic data cracking,让“结构化”成为智能体推理的副产物:在打开文档回答问题时,顺带以边际成本提取有依据的结构化数据,供后续相关查询复用。论文报告,在 FanOutQA 上仅每道测试题扩展一条相关问题,即可降低 53% 成本并保持准确率;若预先存在理想结构化存储,成本可降至约 1/28。

事件概述或研究问题

  • 企业 AI 的“大赌注”是让 LLM agent 从网页、报告、合同、监管文件、财报电话会和 PDF 等非结构化来源中提取证据并回答复杂问题。
  • 当前做法的问题是:每一次问答都要反复打开大文档、跨文档拼接分散证据,token 消耗可达百万级,成本高到难以规模落地。
  • 如果数据预先结构化,同样问题可以退化为廉价的数据库查询;但“先把所有文档结构化”并不可行——文档可能的结构远超任何实际工作负载所需,而且哪些结构有用、哪些文档值得处理,只有等真实查询出现后才知道。
  • 因此作者提出:不应预先穷举式结构化,而应把结构化行为嵌入智能体推理本身,按需、投机地累积可复用结构。

方法/产品要点

  • Agentic data cracking:一种自适应、投机式的非结构化数据结构化方法,结构化是推理的副产物。
  • 自适应性(adaptive):由实际观察到的查询决定何时触发结构化、什么内容值得结构化。
  • 投机性(speculative):结构化不只服务当前问题,还会提取大概率服务后续相关查询的结构。
  • 工作流程:智能体为了回答某个问题打开文档时,一个“cracking 子智能体”从已经加载的上下文(already-loaded context)中分叉出来,以边际成本提取有依据的结构化数据。
  • 累积效应:随着时间推移,越来越多查询可以被已有结构化数据完全覆盖,无需再打开原始文档;智能体逐渐以接近 RAG(检索增强生成)的成本维持准确率。
  • 定位:这是面向 agentic reasoning 的下一代数据基础设施的第一步——在模型之下形成一个共享数据基底,让推理已经“付过费”发现的知识沉淀下来。

主要结果或产业意义

  • 在 FanOutQA 基准上,如果使用理想预结构化存储,推理成本约为直接对原始非结构化文档做智能体推理的 1/28;问题在更多文档间“扇出”时,成本差距可扩大到数量级。
  • 仅给每道测试题扩展一条相关问题,agentic data cracking 削减成本 53%,同时保持准确率。
  • 产业意义:它直接指向企业 AI 成本瓶颈——不是要求 LLM 更能“读”,而是让文档在推理过程中逐步变成可供查询的结构化资产;对知识库、RAG 系统、Agent 框架的数据层设计有参考价值。

为什么重要

  • “能答但用不起”是 LLM agent 在知识密集场景落地的主要障碍;该方法把“结构化”从离线预处理变成在线推理的副产品,改变了成本结构。
  • 它提供了一个更宏观的视角:未来数据基础设施应让推理已经花过的钱产生长期复利,而不是每次问答都重新负担相同的 token 开销。
  • 增量信息:已有相关卡片未覆盖这一主题;本卡片补充的是 LLM agent 成本/数据基础设施方向的新概念与定量结果。

与既有脉络的关系

本卡片与已有三张卡片无直接事实重叠:不涉及循环肿瘤细胞表型分类、QANTA 多模态问答或自蒸馏推理。它可作为“Agentic AI 成本与数据基础设施”脉络的新增条目;核心增量是 agentic data cracking 方法与 FanOutQA 上的 28X/53% 成本数据。

局限与不确定性

以下信息在材料中无法确认,需进一步核实(待核实):

  • 论文是否仅报告 FanOutQA 单一基准;在其他问答/文档推理基准上的表现未知。
  • “成本”的确切口径(token 数、美元成本、延迟)和具体实验设置未给出。
  • “保持准确率”的准确率数值、对照基线以及统计显著性未在摘要中给出。
  • “每条测试题扩展一条相关问题”的具体构造方式,以及对结果的影响程度未知。
  • cracking 子智能体的边际开销、失败模式、真实工作负载中的可扩展性未知。
  • “grounded structure”的校验方式(如何确保提取内容忠实于原文)在摘要中未展开。

可用于图书/PPT/简报的角度

  • 痛点开场:一个企业复杂问题,LLM agent 可能消耗上百万 token——钱花在哪?花在反复打开大文档找证据。
  • 反差数据:理想结构化存储下同一问题成本降至约 1/28;跨文档越多,差距可达数量级。
  • 核心比喻:不要“预先给所有可能问题建索引”,而是让每个问题把自己走过的路变成一条可复用的索引。
  • 概念图:主问题 → agent 打开原始文档 → cracking 子智能体提取结构化知识 → 后续相关问题直接查结构化层。
  • 观点升华:下一代数据基础设施,应该让“推理已经发现的知识”留在模型之下,持续服务未来查询。

原始材料

  • 英文标题:Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data
  • arXiv ID:2608.31082v1
  • 作者:Milad Rezaei Hajidehi, Qitong Wang, Stratos Idreos
  • 发布/更新时间:2026-08-31T16:53:45Z
  • 分类:cs.AI(cs.CL, cs.DB)
  • 摘要链接:https://arxiv.org/abs/2608.31082v1
  • PDF 链接:https://arxiv.org/pdf/2608.31082v1