AI消息速览

ABSeeker——通过答案回溯的信用分配训练长程搜索智能体

事件日期 2026-08-05 · 学术前沿 · 已接受

事件日期2026-08-05
信息日期2026-08-05
入库日期2026-08-07
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:ABSeeker——通过答案回溯的信用分配训练长程搜索智能体

一句话结论

ABSeeker 提出 Answer-Backtracked Credit Assignment(ABC)框架,利用从最终答案回溯出的中间线索,将稀疏的轨迹级结果转换为稠密的步骤级奖励,从而训练长程搜索智能体;在 4B 参数规模下,其 BrowseComp 得分可从 37.3% 提升至 55.3%(配合上下文管理),接近约 30B 参数的大模型表现。

事件概述或研究问题

长程搜索智能体需要依次执行搜索、检索、验证、整合证据等多个步骤才能得到最终答案。现有方法在监督微调(SFT)和强化学习(RL)中通常把一条轨迹内的所有步骤一视同仁地对待,难以区分有用动作与错误或冗余动作。本文提出一种细粒度信用分配方法,把稀疏的“整条轨迹对错”转化为稠密的“每一步是否有用”的监督信号。

方法/产品要点

  • 核心框架:ABC(Answer-Backtracked Credit Assignment)——答案回溯信用分配。
  • 第一步:Answer-Backtracked Clue Recovery。给定一条可能比较隐晦的查询及其标准答案,从答案出发回溯,恢复解答该问题所需的一系列中间线索。
  • 第二步:Clue-Anchored Step Scoring。用恢复出的线索对每个搜索步骤进行评分,从而把稀疏的二元结果监督转化为稠密的步骤级奖励。
  • 训练策略:
    • ABC-SFT:用步骤级分数对每一步的损失进行重加权。
    • ABC-GRPO:把步骤级分数作为 GRPO 强化学习的奖励。
  • 产品/模型:基于 Qwen3.5-4B,仅用 8.5k 条示例训练得到 ABSeeker。

主要结果或产业意义

  • ABSeeker 在 BrowseComp 上达到 37.3%,在 BrowseComp-ZH 上达到 39.1%。
  • 加入上下文管理后,两个成绩分别提升到 55.3% 和 52.9%。
  • 结果显著超过同规模(4B)智能体,并接近约 30B 参数的更大模型。
  • 意义:说明“答案回溯 + 步骤级信用分配”能有效利用少量数据和小模型训练出强搜索智能体,对低成本部署有参考价值。

与既有脉络的关系

与已有卡片中的 TRACE、CompactionRL 一样,ABC 关注长程智能体的训练信号问题。本条卡片的增量信息在于:ABC 不是做回合级奖励分配,也不是做上下文压缩,而是通过“从答案回溯线索”把稀疏轨迹结果改造成稠密步骤级奖励,并同时适配 SFT 的损失重加权和 GRPO 的奖励信号;其效果在 4B 规模上逼近约 30B 模型,展示了步骤级信用分配的潜力。

为什么重要

长程搜索智能体的训练难点在于:一条轨迹即使最终失败,其中也可能包含正确步骤;反之最终成功也可能包含冗余或错误动作。ABC 提供了一种“只看查询和标准答案”即可生成步骤级奖励的思路,无需人工过程标注,就能奖励失败轨迹中的有效步骤、抑制错误或冗余动作。这对提升小模型搜索能力、降低对大规模奖励模型或人工标注的依赖有重要意义。

局限与不确定性

  • 摘要未披露完整的实现细节,如线索恢复的具体算法、步骤评分如何与上下文管理结合等,需阅读全文确认。
  • 文中提到的“约 30B 模型”具体型号、对比基线和实验设置待核实。
  • 是否依赖特定领域或英文数据,中文场景的泛化程度待核实。
  • 计算开销、训练稳定性、失败案例分析等未在摘要中说明,待核实。

可用于图书/PPT/简报的角度

  • 案例切入:以 ABSeeker 为例,说明“用答案倒推步骤”如何为搜索智能体提供过程奖励。
  • 对比视角:从“整条轨迹对错”到“每一步有用与否”,讲解长程智能体信用分配的演变。
  • 效率故事:4B 模型 + 8.5k 示例 + 答案回溯,就能接近约 30B 模型的表现,适合用来讨论小模型训练策略。

原始材料

  • 英文标题:ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
  • 英文关键词(据摘要提取):Long-Horizon Search Agents; Answer-Backtracked Credit Assignment; ABSeeker; Dense Step-Level Rewards
  • arXiv ID:2608.05102v1
  • 来源 URL:https://arxiv.org/abs/2608.05102v1
  • 作者:Yijun Lu, Rui Ye, Jiajun Wang, Yuwen Du, Tian Jin, Songhua Liu, Siheng Chen
  • 发布时间:2026-08-05