知识卡片:让非结构化数据在智能体推理中自适应结构化
英文标题:Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data
英文关键词(依据摘要提炼):agentic data cracking; adaptive structuring; unstructured data; LLM agents; token efficiency; data infrastructure
原始来源:https://arxiv.org/abs/2608.31082v1
一句话结论
面对网页、报告、合同、PDF 等非结构化数据,LLM 智能体虽然能完成复杂问答,但单次可能消耗上百万 token。本文提出 agentic data cracking,让“结构化”成为智能体推理的副产物:在打开文档回答问题时,顺带以边际成本提取有依据的结构化数据,供后续相关查询复用。论文报告,在 FanOutQA 上仅每道测试题扩展一条相关问题,即可降低 53% 成本并保持准确率;若预先存在理想结构化存储,成本可降至约 1/28。
事件概述或研究问题
- 企业 AI 的“大赌注”是让 LLM agent 从网页、报告、合同、监管文件、财报电话会和 PDF 等非结构化来源中提取证据并回答复杂问题。
- 当前做法的问题是:每一次问答都要反复打开大文档、跨文档拼接分散证据,token 消耗可达百万级,成本高到难以规模落地。
- 如果数据预先结构化,同样问题可以退化为廉价的数据库查询;但“先把所有文档结构化”并不可行——文档可能的结构远超任何实际工作负载所需,而且哪些结构有用、哪些文档值得处理,只有等真实查询出现后才知道。
- 因此作者提出:不应预先穷举式结构化,而应把结构化行为嵌入智能体推理本身,按需、投机地累积可复用结构。
方法/产品要点
- Agentic data cracking:一种自适应、投机式的非结构化数据结构化方法,结构化是推理的副产物。
- 自适应性(adaptive):由实际观察到的查询决定何时触发结构化、什么内容值得结构化。
- 投机性(speculative):结构化不只服务当前问题,还会提取大概率服务后续相关查询的结构。
- 工作流程:智能体为了回答某个问题打开文档时,一个“cracking 子智能体”从已经加载的上下文(already-loaded context)中分叉出来,以边际成本提取有依据的结构化数据。
- 累积效应:随着时间推移,越来越多查询可以被已有结构化数据完全覆盖,无需再打开原始文档;智能体逐渐以接近 RAG(检索增强生成)的成本维持准确率。
- 定位:这是面向 agentic reasoning 的下一代数据基础设施的第一步——在模型之下形成一个共享数据基底,让推理已经“付过费”发现的知识沉淀下来。
主要结果或产业意义
- 在 FanOutQA 基准上,如果使用理想预结构化存储,推理成本约为直接对原始非结构化文档做智能体推理的 1/28;问题在更多文档间“扇出”时,成本差距可扩大到数量级。
- 仅给每道测试题扩展一条相关问题,agentic data cracking 削减成本 53%,同时保持准确率。
- 产业意义:它直接指向企业 AI 成本瓶颈——不是要求 LLM 更能“读”,而是让文档在推理过程中逐步变成可供查询的结构化资产;对知识库、RAG 系统、Agent 框架的数据层设计有参考价值。
为什么重要
- “能答但用不起”是 LLM agent 在知识密集场景落地的主要障碍;该方法把“结构化”从离线预处理变成在线推理的副产品,改变了成本结构。
- 它提供了一个更宏观的视角:未来数据基础设施应让推理已经花过的钱产生长期复利,而不是每次问答都重新负担相同的 token 开销。
- 增量信息:已有相关卡片未覆盖这一主题;本卡片补充的是 LLM agent 成本/数据基础设施方向的新概念与定量结果。
与既有脉络的关系
本卡片与已有三张卡片无直接事实重叠:不涉及循环肿瘤细胞表型分类、QANTA 多模态问答或自蒸馏推理。它可作为“Agentic AI 成本与数据基础设施”脉络的新增条目;核心增量是 agentic data cracking 方法与 FanOutQA 上的 28X/53% 成本数据。
局限与不确定性
以下信息在材料中无法确认,需进一步核实(待核实):
- 论文是否仅报告 FanOutQA 单一基准;在其他问答/文档推理基准上的表现未知。
- “成本”的确切口径(token 数、美元成本、延迟)和具体实验设置未给出。
- “保持准确率”的准确率数值、对照基线以及统计显著性未在摘要中给出。
- “每条测试题扩展一条相关问题”的具体构造方式,以及对结果的影响程度未知。
- cracking 子智能体的边际开销、失败模式、真实工作负载中的可扩展性未知。
- “grounded structure”的校验方式(如何确保提取内容忠实于原文)在摘要中未展开。
可用于图书/PPT/简报的角度
- 痛点开场:一个企业复杂问题,LLM agent 可能消耗上百万 token——钱花在哪?花在反复打开大文档找证据。
- 反差数据:理想结构化存储下同一问题成本降至约 1/28;跨文档越多,差距可达数量级。
- 核心比喻:不要“预先给所有可能问题建索引”,而是让每个问题把自己走过的路变成一条可复用的索引。
- 概念图:主问题 → agent 打开原始文档 → cracking 子智能体提取结构化知识 → 后续相关问题直接查结构化层。
- 观点升华:下一代数据基础设施,应该让“推理已经发现的知识”留在模型之下,持续服务未来查询。
原始材料
- 英文标题:Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data
- arXiv ID:2608.31082v1
- 作者:Milad Rezaei Hajidehi, Qitong Wang, Stratos Idreos
- 发布/更新时间:2026-08-31T16:53:45Z
- 分类:cs.AI(cs.CL, cs.DB)
- 摘要链接:https://arxiv.org/abs/2608.31082v1
- PDF 链接:https://arxiv.org/pdf/2608.31082v1