AI消息速览

TurnSight:回合级事后自我蒸馏用于工具集成推理

事件日期 2026-08-04 · 学术前沿 · 已接受

事件日期2026-08-04
信息日期2026-08-04
入库日期2026-08-05
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:TurnSight:回合级事后自我蒸馏用于工具集成推理

英文标题:TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning
英文关键词(依摘要术语归纳):Tool-Integrated Reasoning; Turn-Level Hindsight Self-Distillation; Reinforcement Learning; Sparse Credit Assignment; LLM Agent

一句话结论

TurnSight 是一种面向工具集成推理(TIR)的回合级事后自我蒸馏框架:它从智能体实际执行结果中反推监督信号,构造多个不同前瞻视野的事后视图,利用跨视野方向一致性筛选可靠信号,再在多个同源采样轨迹(sibling rollouts)间归一化,并用于自适应调制强化学习优势;在三个基准上验证了有效性。

事件概述或研究问题

  • 工具集成推理让大语言模型通过迭代调用工具解决复杂任务,但长程任务中强化学习常依赖轨迹级监督,细粒度信用分配不足。
  • 在策略自我蒸馏能提供更密集的信号,但现有方法通常从标准答案或检索技能中构造教师上下文,未必匹配智能体实际访问的状态。
  • 进一步地,token 级监督难以体现工具交互的回合级结构。

方法/产品要点

  • 执行条件化事后监督:TurnSight 直接从执行条件化的 hindsight 推导监督,而非依赖 ground-truth 答案或检索技能。
  • 多视野构造:构建多个不同前瞻步长(lookahead horizons)的 hindsight 视图。
  • 跨视野方向一致性:通过多视野间监督方向的一致性,筛选可靠监督。
  • 归一化与优势调制:将筛选出的 hindsight 信号在 sibling rollouts 间归一化,并自适应地调制 RL 优势,同时保留原始优化方向。

主要结果或产业意义

  • 在三个基准上的广泛实验证明了 TurnSight 的有效性。
  • 三个基准的具体名称、实验设置和数值指标未在摘要中给出(待核实)。
  • 代码已公开:https://github.com/quchangle1/TurnSight

为什么重要

  • 同时回应了长程 TIR 中“轨迹级监督过稀疏”和“token 级监督忽略回合结构”两个问题,为工具调用场景的强化学习提供了回合级事后蒸馏的新思路。
  • 与已有相关卡片中的 TRACE 相比,本条增量在于:TRACE 侧重无需额外评判器/过程标注的回合级信用分配,而 TurnSight 使用“执行条件化 hindsight + 多视野一致性筛选 + sibling rollouts 归一化”来调制 RL 优势,属于不同的技术路线。

局限与不确定性

  • 摘要未说明三个基准的名称、具体任务类型及对比基线(待核实)。
  • 未报告效果提升幅度、计算开销或训练成本(待核实)。
  • 跨视野方向一致性的具体阈值、判定方式及失败情况未在摘要中说明(待核实)。
  • 是否依赖额外教师模型或推理时开销未见描述(待核实)。

与既有脉络的关系

  • 本文是面向 LLM 智能体强化学习/信用分配的新方法,发布于 2026-08-04。
  • 相对于 TRACE 的回合级奖励分配,TurnSight 强调“回合级事后自我蒸馏”,核心不再是 TD 时序差分信号,而是由执行结果反推的多视野 hindsight 监督。

可用于图书/PPT/简报的角度

  • 用“复盘”来解释 hindsight:不是直接照标准答案,而是让智能体基于自己实际走过的工具调用路径做多版本复盘,并优先采纳多个复盘视角一致的意见。
  • 用“回合级 vs token 级”说明工具交互中信用分配的粒度问题。
  • 通过开源代码,可作为大模型工具调用训练方法的工程案例展示。

原始材料

  • 标题:TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning
  • arXiv ID:2608.04007v1
  • 作者:Changle Qu, Sunhao Dai, Hengyi Cai, Yuqi Zhou, Xinran Chen, Simon, Jun Xu
  • 提交/更新时间:2026-08-04T17:59:21Z
  • 分类:cs.CL, cs.AI
  • 摘要链接:https://arxiv.org/abs/2608.04007v1
  • PDF 链接:https://arxiv.org/pdf/2608.04007v1
  • 代码:https://github.com/quchangle1/TurnSight
  • 英文关键词(依摘要归纳):Tool-Integrated Reasoning; Turn-Level Hindsight Self-Distillation; Reinforcement Learning; Sparse Credit Assignment; LLM Agent