知识卡片:TRACE:通过信用估计实现长程智能体的回合级奖励分配
英文标题:TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
英文关键词:Credit Assignment; Long-Horizon Agents; Reinforcement Learning; Temporal-Difference Learning; Tool Use
一句话结论
TRACE 是一种无需额外评判器或过程标注的密集信用分配方法,通过冻结参考模型的对数概率与时序差分(TD)变化为每个智能体动作分配奖励,在纯强化学习(无监督微调、无中间训练阶段、无实时网络数据)下显著提升了长程搜索智能体的工具使用能力。
事件概述或研究问题
多轮智能体在执行复杂任务时,需要经过数十至数百次工具调用序列才能给出最终答案,这使得后训练阶段面临根本性的信用分配挑战。仅基于最终结果的奖励在短程推理中可靠,但在长轨迹中变得稀疏且方差大,甚至可能误导:一次失败的探索中可能包含许多有用的动作,但结果奖励会将这些动作与最终错误等同对待,分配给它们相同的负优势。
方法/产品要点
- 核心思想:将智能体的一次探索轨迹表示为工具调用边界处的状态转移序列;从冻结的参考模型(frozen reference model)中获取黄金答案的对数概率,将其转换为对数比值状态值(log-ratio state values);然后通过时序差分(TD)变化推导出每个动作的密集奖励。
- 技术特点:不需要训练额外的评判器(critic)或过程标签(process labels);其单步对数比值 TD 分量在冗余工具调用上具有“望远镜”效应(自动抵消冗余步骤的影响)。
- 训练管线:完全基于纯强化学习,无需冷启动阶段的监督微调(SFT)、无需智能体中间训练阶段、也无需使用实时网络数据。
主要结果或产业意义
- 在闭源网络基准 BrowseComp-Plus 上,TRACE 将 Qwen3-4B 的准确率从 7.2% 提升至 35.6%(提升约 4.9 倍),将 Qwen3-30B-A3B 从 8.4% 提升至 42.6%(提升约 5.1 倍)。
- 学习得到搜索行为能够迁移到开放网络基准(open-web benchmarks),且在强化学习训练过程中展现出更早的改进和更快的收敛。
为什么重要
与已有的长程智能体训练方法(如 CompactionRL 使用上下文压缩、主动记忆代理使用结构化记忆、Cortex 使用技能基元)不同,TRACE 专注于后训练阶段的信用分配问题,通过纯 RL 从零提升基础模型的工具使用能力,无需依赖复杂的前置训练阶段或外部记忆结构。其增量价值在于:提供了一种轻量级、无需额外标注的密集奖励替代方案,为长程智能体的强化学习训练降低了门槛。
局限与不确定性
- 材料中未提及 TRACE 在多步推理(如数学、代码)任务上的表现,仅验证了长程搜索任务(BrowseComp-Plus 及相关开放网络基准)。在其他类型的长程智能体任务(如自主导航、多步问答)上的泛化性待核实。
- 冻结参考模型的质量对奖励信号的影响未知。如果参考模型本身在目标领域表现不佳,对数概率转换的效果可能需要进一步研究。
- 实验仅基于 Qwen3 系列特定规模的模型(4B 与 30B-A3B),在更大或更小模型上的效果待核实。
可用于图书/PPT/简报的角度
- 图表推荐:绘制 BrowseComp-Plus 上 TRACE 与基线(结果奖励训练)的性能对比折线图,展示随训练步数的准确率曲线(更早提升、更快收敛)。
- 类比说明:可将 TRACE 比喻为“为长跑运动员的每一公里都提供即时反馈,而非只在终点告知成绩”,帮助非专业读者理解密集奖励的价值。
- 幻灯片要点:
- 问题:长程智能体信用分配困境
- 方案:对数概率 TD 奖励实现逐动作信用估计
- 亮点:纯 RL、无需 SFT、无需过程标注
- 成果:Qwen3-4B 在 BrowseComp-Plus 上提升近 5 倍
原始材料
- 来源:arXiv 预印本,ID 2607.13988v1(2026-07-15)
- 标题:TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
- 链接:https://arxiv.org/abs/2607.13988v1