AI消息速览

接力在线策略蒸馏(Relay-OPD)

事件日期 2026-07-28 · 学术前沿 · 已接受

事件日期2026-07-28
信息日期2026-07-28
入库日期2026-07-29
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:接力在线策略蒸馏(Relay-OPD)

一句话结论
Relay-OPD 通过让教师模型在学生犯错时短暂“接力”纠正,解决了在线策略蒸馏中因前缀失败导致后续生成持续偏航的问题,在 1.7B 学生模型上平均比标准 OPD 提升 5.73%,且训练轨迹长度减半。

事件概述或研究问题
在线策略蒸馏(OPD)在每一步生成时利用教师模型提供 token 级监督,但存在“前缀失败”缺陷:一旦学生模型走上错误的推理方向,后续所有生成都会基于这个偏差继续,导致监督信号不可靠且浪费计算资源。本文试图在不引入额外标注的前提下,自动检测学生偏离时刻并触发教师干预。

方法/产品要点

  • 关键发现:教师与学生在失败前缀上存在“延续不对称”——教师倾向于重新定向,而学生倾向于沿原方向继续。
  • 利用该不对称性作为无标签的交接触发信号(handoff trigger),设计 Relay-OPD。
  • 训练过程中,在检测到触发点时让教师短暂接管,生成一段“教师腿”(teacher leg),之后学生模型继续生成并基于整条接力轨迹进行优化。
  • 设置有限的接力预算,将干预集中于关键的早期位置,同时避免学生策略偏离过大。
  • 教师模型:Qwen3-4B-Instruct-2507;学生模型:Qwen3-0.6B/1.7B-Non-Thinking。
  • 在八个数学推理基准上进行评估。
  • 训练轨迹长度减少超过 50%(待核实具体压缩比例与衡量方式)。

主要结果或产业意义

  • 在 1.7B 学生模型上,Relay-OPD 在所有八个基准上取得最佳或第二佳结果,平均比标准 OPD 高 5.73%,比最强基线 FastOPD 高 1.49%。
  • 在 0.6B 学生模型上也获得一致性提升(具体数值待核实)。
  • 显著缩短训练轨迹长度,直接降低推理蒸馏的计算成本。
  • 该方法不依赖额外标注,仅利用师生模型的行文差异即可自适应触发干预,适用于多种基础模型蒸馏场景。

为什么重要

  • 现有在线蒸馏方法(如 Direct-OPD、On-Policy Delta Distillation)主要关注如何构造更有效的监督信号,而本工作首次系统处理“前缀失败”这一结构性瓶颈。
  • 相比已有相关卡片,Relay-OPD 提供了新的正交改进方向:通过动态接力机制修正学生路径,而非仅优化奖励信号本身。
  • 训练效率提升(轨迹长度减半)和性能增益同时实现,使小模型蒸馏更实用。

局限与不确定性

  • 交接触发点的检测方法细节及在不同任务(非数学推理)上的泛化能力待核实。
  • 接力预算的具体设置与基于规则还是可学习式触发待明确。
  • 仅验证了 Qwen 系列模型,其他架构(如 LLaMA、Mistral)上的表现待核实。
  • 教师模型本身(4B)也可能存在偏差,若教师自身推理能力不足,接力可能引入错误引导。

可用于图书/PPT/简报的角度

  • “师生接力赛”:类比接力赛中交接棒时机决定最终成绩,阐释蒸馏中教师主动纠错的重要性。
  • 成本控制视角:用更少的训练步数(轨迹长度)获得更好的学生模型,适合在资源受限场景下部署。
  • 与之前工作的对比:Direct-OPD 从弱到强,Delta-OPD 用差值信号,Relay-OPD 改用过程干预,形成技术演进脉络。

原始材料

  • URL: https://arxiv.org/abs/2607.26057v1
  • Title: Pass the Baton: Trajectory-Relayed On-Policy Distillation
  • Keywords: foundation-model, on-policy distillation, prefix failure, relay mechanism (from context; exact keywords list未提供)
  • Source: 仅基于 arXiv 摘要生成,正文内容未经核实,部分细节标注为“待核实”。