AI消息速览

LLM数据智能体的轨迹完整性:可审计结构化推理的愿景

事件日期 2026-08-26 · 学术前沿 · 已接受

事件日期2026-08-26
信息日期2026-08-26
入库日期2026-08-28
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:LLM数据智能体的轨迹完整性:可审计结构化推理的愿景

英文标题:Trace Integrity for LLM Data Agents: A Vision for Auditable Structured Reasoning in Real-World Systems
英文关键词:Trace Integrity; LLM Data Agents; Auditable Structured Reasoning; Execution Contracts; CAIT Rate
原始来源:https://arxiv.org/abs/2608.26036v1

一句话结论

对LLM数据智能体而言,答案正确不足以证明可靠:必须进一步检查答案背后的“计算轨迹”是否完整、可执行、符合模式、忠实于算子、可重放、与答案一致且可审计;仅凭答案准确率会高估真实系统的可靠性。

事件概述或研究问题

论文针对结构化数据任务中的部署可靠性问题。论文指出,基准测试中“答案正确”的样本可能由无效的计算轨迹产生;而自然语言推理和自由形式理由无法可靠地转化为真实系统所需的算子级程序。这种“结构鸿沟”(Structure Gap)导致部署失败。为此,论文提出“轨迹完整性”(Trace Integrity)作为部署可靠性标准,并引入执行契约和CAIT率来度量并缓解该问题。

方法/产品要点

  • Trace Integrity 标准:要求答案背后的计算记录满足以下性质:显式(explicit)、可执行(executable)、模式有效(schema-valid)、算子忠实(operator-faithful)、可重放(replayable)、答案一致(answer-consistent)和可审计(auditable)。
  • 执行契约(Execution Contracts):一种结构化工件,将用户意图绑定到模式元素、算子计划、假设、可执行查询、验证状态以及最终答案的链接。
  • CAIT率(Correct Answer / Invalid Trace Rate):衡量仅依赖答案的评估将“计算上不支持的输出”计入成功的频率。

主要结果或产业意义

在BIRD Mini-Dev上的初步演示中:

  • Direct SQL:答案准确率20%,轨迹完整通过率39%,CAIT率55%;
  • Operation Summary + SQL:答案准确率22%,轨迹完整通过率43%,CAIT率59.1%;
  • Contract-First SQL:答案准确率24%,轨迹完整通过率40%,CAIT率45.8%。

这些结果表明:答案准确率、轨迹有效性和静默失败风险是相互独立的评估信号。对真实世界LLM数据智能体,仅评估输出是否匹配参考答案是不够的,还必须确认输出有可审计的计算过程支撑。

为什么重要

已有相关卡片分别关注LLM在真实世界数据分析中的性能差距、主动智能体基准、道德推理中的结构化调整。本卡片的增量信息在于:它不直接衡量任务表现,而是提出了一个更严格的“可靠性”维度——即使答案正确,过程也可能无效。对于金融、医疗、政务等需要审计和合规的数据系统,这为“过程可审计”提供了可操作的标准和指标(Trace Integrity、执行契约、CAIT率)。

局限与不确定性

  • 该文标题为“A Vision”,属于愿景/立场类论文;执行契约的具体格式、自动判定方法、扩展到其他任务的效果等细节待核实。
  • 实证仅基于BIRD Mini-Dev小规模数据集,结论在更广泛真实系统中的泛化性待核实。
  • CAIT率“高”的具体危害阈值、与下游业务风险的关系,论文摘要未提供更多量化证据,待核实。

可用于图书/PPT/简报的角度

  • “答案对,过程错:LLM数据智能体的静默失败风险”
  • “从答案正确到过程可审计:下一代评估标准”
  • “结构鸿沟:为什么自然语言推理不能替代算子级程序”
  • “三张指标看懂LLM数据智能体:准确率、轨迹完整性、CAIT率”

原始材料

  • 英文标题:Trace Integrity for LLM Data Agents: A Vision for Auditable Structured Reasoning in Real-World Systems
  • 作者:Srimonti Dutta, Akshata Kishore Moharir
  • 发布时间:2026-08-26(arXiv:2608.26036v1)
  • 栏目:cs.AI; cs.CL
  • URL:https://arxiv.org/abs/2608.26036v1
  • PDF:https://arxiv.org/pdf/2608.26036v1