知识卡片:TurnSight:回合级事后自我蒸馏用于工具集成推理
英文标题:TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning
英文关键词(依摘要术语归纳):Tool-Integrated Reasoning; Turn-Level Hindsight Self-Distillation; Reinforcement Learning; Sparse Credit Assignment; LLM Agent
一句话结论
TurnSight 是一种面向工具集成推理(TIR)的回合级事后自我蒸馏框架:它从智能体实际执行结果中反推监督信号,构造多个不同前瞻视野的事后视图,利用跨视野方向一致性筛选可靠信号,再在多个同源采样轨迹(sibling rollouts)间归一化,并用于自适应调制强化学习优势;在三个基准上验证了有效性。
事件概述或研究问题
- 工具集成推理让大语言模型通过迭代调用工具解决复杂任务,但长程任务中强化学习常依赖轨迹级监督,细粒度信用分配不足。
- 在策略自我蒸馏能提供更密集的信号,但现有方法通常从标准答案或检索技能中构造教师上下文,未必匹配智能体实际访问的状态。
- 进一步地,token 级监督难以体现工具交互的回合级结构。
方法/产品要点
- 执行条件化事后监督:TurnSight 直接从执行条件化的 hindsight 推导监督,而非依赖 ground-truth 答案或检索技能。
- 多视野构造:构建多个不同前瞻步长(lookahead horizons)的 hindsight 视图。
- 跨视野方向一致性:通过多视野间监督方向的一致性,筛选可靠监督。
- 归一化与优势调制:将筛选出的 hindsight 信号在 sibling rollouts 间归一化,并自适应地调制 RL 优势,同时保留原始优化方向。
主要结果或产业意义
- 在三个基准上的广泛实验证明了 TurnSight 的有效性。
- 三个基准的具体名称、实验设置和数值指标未在摘要中给出(待核实)。
- 代码已公开:https://github.com/quchangle1/TurnSight
为什么重要
- 同时回应了长程 TIR 中“轨迹级监督过稀疏”和“token 级监督忽略回合结构”两个问题,为工具调用场景的强化学习提供了回合级事后蒸馏的新思路。
- 与已有相关卡片中的 TRACE 相比,本条增量在于:TRACE 侧重无需额外评判器/过程标注的回合级信用分配,而 TurnSight 使用“执行条件化 hindsight + 多视野一致性筛选 + sibling rollouts 归一化”来调制 RL 优势,属于不同的技术路线。
局限与不确定性
- 摘要未说明三个基准的名称、具体任务类型及对比基线(待核实)。
- 未报告效果提升幅度、计算开销或训练成本(待核实)。
- 跨视野方向一致性的具体阈值、判定方式及失败情况未在摘要中说明(待核实)。
- 是否依赖额外教师模型或推理时开销未见描述(待核实)。
与既有脉络的关系
- 本文是面向 LLM 智能体强化学习/信用分配的新方法,发布于 2026-08-04。
- 相对于 TRACE 的回合级奖励分配,TurnSight 强调“回合级事后自我蒸馏”,核心不再是 TD 时序差分信号,而是由执行结果反推的多视野 hindsight 监督。
可用于图书/PPT/简报的角度
- 用“复盘”来解释 hindsight:不是直接照标准答案,而是让智能体基于自己实际走过的工具调用路径做多版本复盘,并优先采纳多个复盘视角一致的意见。
- 用“回合级 vs token 级”说明工具交互中信用分配的粒度问题。
- 通过开源代码,可作为大模型工具调用训练方法的工程案例展示。
原始材料
- 标题:TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning
- arXiv ID:2608.04007v1
- 作者:Changle Qu, Sunhao Dai, Hengyi Cai, Yuqi Zhou, Xinran Chen, Simon, Jun Xu
- 提交/更新时间:2026-08-04T17:59:21Z
- 分类:cs.CL, cs.AI
- 摘要链接:https://arxiv.org/abs/2608.04007v1
- PDF 链接:https://arxiv.org/pdf/2608.04007v1
- 代码:https://github.com/quchangle1/TurnSight
- 英文关键词(依摘要归纳):Tool-Integrated Reasoning; Turn-Level Hindsight Self-Distillation; Reinforcement Learning; Sparse Credit Assignment; LLM Agent