AI消息速览

On-Policy Delta Distillation

事件日期 2026-07-16 · 学术前沿 · 已接受

事件日期2026-07-16
信息日期2026-07-16
入库日期2026-07-18
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:On-Policy Delta Distillation

英文标题: On-Policy Delta Distillation
英文关键词: on-policy distillation, delta signal, reasoning LLMs, post-training
原始来源: https://arxiv.org/abs/2607.15161v1

一句话结论

将教师模型与其基础模型(未进行推理指令微调)的输出概率差定义为“delta信号”,并以此作为蒸馏奖励,能显著提升在线策略强化学习蒸馏的效果,使推理大模型在极短的后训练期内达到强性能。

事件概述或研究问题

在线策略蒸馏(On-policy distillation)是强化学习中替代奖励模型的一种后训练方法,通过教师模型提供 token 级监督来缓解奖励模型带来的约束。然而,其基础设计(直接模仿教师输出分布)尚未被深入探索。本文提出一种新的蒸馏奖励——delta 信号,旨在更直接地传递推理能力。

方法/产品要点

  • Delta 信号定义:教师模型输出概率与其基础模型(推理指令微调前的版本)输出概率之差,即 delta = P_teacher - P_base。该差值捕获了推理微调带来的变化,因此能更直接地传递推理能力。
  • 方法名称:On-Policy Delta Distillation(OPD²)。
  • 核心训练流程:在 RL 在线策略框架下,使用 delta 信号代替传统教师模型的软标签(如 KL 散度)作为奖励信号来更新学生模型。

主要结果或产业意义

在数学、科学和代码推理基准上,OPD² 表现稳定优于传统的在线策略蒸馏方法。仅需较短的后训练周期,推理型大模型即可达到有竞争力的性能。代码将开源(https://github.com/naver-ai/opd2)。

为什么重要

  • 首次系统探索在线策略蒸馏中“应该模仿什么”这一根本问题,提出基于差值的信号设计。
  • 与已有相关卡片(如 Direct-OPD)形成互补:Direct-OPD 利用弱模型 RL 引发的策略偏移作为信号,而 OPD² 利用教师模型与自身基础模型的差异,两者均强调“差值”而非直接模仿,但适用场景和理论基础不同。OPD² 更侧重推理能力的显式迁移,且无需弱模型参与。

局限与不确定性

  • 论文未在材料中明确给出基础模型与教师模型的具体规模、训练超参数等细节,需查看全文确认。
  • Delta 信号的有效性是否依赖于基础模型与教师模型之间的差距大小?是否随教师模型推理能力的提升而饱和?待核实。
  • 实验仅在数学、科学、代码推理领域进行,在其他推理任务(如常识推理、多跳问答)上的泛化能力需进一步验证。

可用于图书/PPT/简报的角度

  • 解释“差分学习”在强化学习蒸馏中的价值:学习“变化”比学习“最终状态”更高效。
  • 对比三种蒸馏方式:传统分布匹配(KL 散度)、Direct-OPD 的策略偏移、OPD² 的 delta 信号,说明各自适用场景。
  • 案例:如何用教师模型和其微调前的基础模型,快速训出小型推理模型。

原始材料

Fetched title: On-Policy Delta Distillation
Fetched description: On-policy distillation is an alternative post-training method in reinforcement learning that alleviates the constraints imposed by reward models by providing token-level supervision from a teacher model. ... We introduce a new distillation reward, termed the delta signal, instead of directly imitating the teacher's output distribution. The delta signal is defined as the difference between the teacher model and its base model prior to instruction tuning for reasoning capability. ... Experiments across mathematics, science, and code-reasoning benchmarks demonstrate that OPD² consistently outperforms conventional on-policy distillation, enabling reasoning LLMs to achieve strong performance with only a short post-training period.

PDF URL: https://arxiv.org/pdf/2607.15161v1