AI消息速览

TrajDebug:追踪长时程智能体轨迹中的错误生命周期以识别关键失效

事件日期 2026-08-06 · 学术前沿 · 已接受

事件日期2026-08-06
信息日期2026-08-06
入库日期2026-08-07
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:TrajDebug:追踪长时程智能体轨迹中的错误生命周期以识别关键失效

一句话结论

TrajDebug 提出一种按“错误生命周期”追踪 LLM 智能体长轨迹的新框架,通过区分局部错误与真正导致最终失败的关键错误,在多个智能体基准上取得最优总体性能,并配套构建了 486 条人工标注的失败轨迹基准 TrajErrBench。

事件概述或研究问题

LLM 智能体在复杂领域表现强大,但长轨迹中容易出现级联错误且难以调试。关键错误检测的目标是定位失败轨迹中“导致最终失败的最早错误步骤”。该任务面临两大挑战:第一,长轨迹中判断某一步是否出错的证据可能分散在相距很远的指令、观察和上下文中;第二,失败轨迹往往包含多个局部错误,但它们对最终失败的影响不同,只有其中一部分真正对失败负责。

方法/产品要点

  • 错误生命周期追踪框架:TrajDebug 将错误视为一个有“发生—发展—结果”的过程来追踪。
  • 多粒度历史压缩:用于处理长轨迹中证据分散的问题,帮助定位和判断单个错误步骤。
  • 基于证据的错误识别:结合分散的指令、观察和上下文证据,判断轨迹中哪些步骤是错误。
  • 关键归因:通过追踪每个错误的“是否被解决”和“终端影响”,区分普通局部错误与真正导致最终失败的关键错误。

主要结果或产业意义

  • 构建了 TrajErrBench 基准:包含 486 条人工标注的失败轨迹,来自 Tau2Bench 和 SWE-Bench Pro,覆盖真实工具使用与编程场景。
  • 在多个多样化的智能体基准上,TrajDebug 的总体性能优于现有基线。
  • 应用研究表明,TrajDebug 输出的诊断结果能为下游智能体提供可操作反馈,帮助改进任务成功率。

为什么重要

长时程智能体系统中的错误级联是实际落地的主要障碍之一。已有相关卡片多从“提升能力”入手,如技能对齐、主动记忆、视频世界模型;TrajDebug 则从“事后诊断”切入,把错误定位从“找单点错误”扩展为“追踪错误生命周期”。其增量在于:直接回应了长轨迹中“多个错误并存、只有少数最终致败”的归因难题,为可解释、可改进的智能体调试提供了新视角。

与既有脉络的关系

与 Cortex 的双向对齐、主动记忆代理的干预机制、Cycle-World 的误差累积缓解不同,TrajDebug 不直接改进任务执行过程,而是面向失败轨迹做关键错误诊断。它延续了“长时程任务可靠性”这一主题,但补充的是“失败后如何定位真正该修的错误”这一缺失环节。

局限与不确定性

  • 摘要未给出与基线对比的具体性能数值,差距大小待核实。
  • TrajErrBench 的标注标准、任务分布和构建细节未在摘要中展开,待核实。
  • 代码与数据计划发布,但具体地址和可用时间待核实。
  • 框架在不同基础模型、不同任务类型上的泛化边界未说明,待核实。

可用于图书/PPT/简报的角度

  • 用“错误也有生命周期”作比喻,解释智能体调试的新思路。
  • 以“486 条真实失败轨迹”作为数据稀缺性和基准建设切入点。
  • 对比“只找最早错误”与“追踪错误是否被修复、是否影响终局”两种判断逻辑。
  • 与已有相关卡片组合,形成“长时程智能体能力提升与失败诊断”专题。

原始材料

  • 英文标题:TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories
  • 英文关键词:LLM agents; long-horizon trajectories; error diagnosis; critical error detection; benchmark
  • 来源:arXiv:2608.06346v1
  • URL:https://arxiv.org/abs/2608.06346v1