知识卡片:ABSeeker——通过答案回溯的信用分配训练长程搜索智能体
一句话结论
ABSeeker 提出 Answer-Backtracked Credit Assignment(ABC)框架,利用从最终答案回溯出的中间线索,将稀疏的轨迹级结果转换为稠密的步骤级奖励,从而训练长程搜索智能体;在 4B 参数规模下,其 BrowseComp 得分可从 37.3% 提升至 55.3%(配合上下文管理),接近约 30B 参数的大模型表现。
事件概述或研究问题
长程搜索智能体需要依次执行搜索、检索、验证、整合证据等多个步骤才能得到最终答案。现有方法在监督微调(SFT)和强化学习(RL)中通常把一条轨迹内的所有步骤一视同仁地对待,难以区分有用动作与错误或冗余动作。本文提出一种细粒度信用分配方法,把稀疏的“整条轨迹对错”转化为稠密的“每一步是否有用”的监督信号。
方法/产品要点
- 核心框架:ABC(Answer-Backtracked Credit Assignment)——答案回溯信用分配。
- 第一步:Answer-Backtracked Clue Recovery。给定一条可能比较隐晦的查询及其标准答案,从答案出发回溯,恢复解答该问题所需的一系列中间线索。
- 第二步:Clue-Anchored Step Scoring。用恢复出的线索对每个搜索步骤进行评分,从而把稀疏的二元结果监督转化为稠密的步骤级奖励。
- 训练策略:
- ABC-SFT:用步骤级分数对每一步的损失进行重加权。
- ABC-GRPO:把步骤级分数作为 GRPO 强化学习的奖励。
- 产品/模型:基于 Qwen3.5-4B,仅用 8.5k 条示例训练得到 ABSeeker。
主要结果或产业意义
- ABSeeker 在 BrowseComp 上达到 37.3%,在 BrowseComp-ZH 上达到 39.1%。
- 加入上下文管理后,两个成绩分别提升到 55.3% 和 52.9%。
- 结果显著超过同规模(4B)智能体,并接近约 30B 参数的更大模型。
- 意义:说明“答案回溯 + 步骤级信用分配”能有效利用少量数据和小模型训练出强搜索智能体,对低成本部署有参考价值。
与既有脉络的关系
与已有卡片中的 TRACE、CompactionRL 一样,ABC 关注长程智能体的训练信号问题。本条卡片的增量信息在于:ABC 不是做回合级奖励分配,也不是做上下文压缩,而是通过“从答案回溯线索”把稀疏轨迹结果改造成稠密步骤级奖励,并同时适配 SFT 的损失重加权和 GRPO 的奖励信号;其效果在 4B 规模上逼近约 30B 模型,展示了步骤级信用分配的潜力。
为什么重要
长程搜索智能体的训练难点在于:一条轨迹即使最终失败,其中也可能包含正确步骤;反之最终成功也可能包含冗余或错误动作。ABC 提供了一种“只看查询和标准答案”即可生成步骤级奖励的思路,无需人工过程标注,就能奖励失败轨迹中的有效步骤、抑制错误或冗余动作。这对提升小模型搜索能力、降低对大规模奖励模型或人工标注的依赖有重要意义。
局限与不确定性
- 摘要未披露完整的实现细节,如线索恢复的具体算法、步骤评分如何与上下文管理结合等,需阅读全文确认。
- 文中提到的“约 30B 模型”具体型号、对比基线和实验设置待核实。
- 是否依赖特定领域或英文数据,中文场景的泛化程度待核实。
- 计算开销、训练稳定性、失败案例分析等未在摘要中说明,待核实。
可用于图书/PPT/简报的角度
- 案例切入:以 ABSeeker 为例,说明“用答案倒推步骤”如何为搜索智能体提供过程奖励。
- 对比视角:从“整条轨迹对错”到“每一步有用与否”,讲解长程智能体信用分配的演变。
- 效率故事:4B 模型 + 8.5k 示例 + 答案回溯,就能接近约 30B 模型的表现,适合用来讨论小模型训练策略。
原始材料
- 英文标题:ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
- 英文关键词(据摘要提取):Long-Horizon Search Agents; Answer-Backtracked Credit Assignment; ABSeeker; Dense Step-Level Rewards
- arXiv ID:2608.05102v1
- 来源 URL:https://arxiv.org/abs/2608.05102v1
- 作者:Yijun Lu, Rui Ye, Jiajun Wang, Yuwen Du, Tian Jin, Songhua Liu, Siheng Chen
- 发布时间:2026-08-05