知识卡片:通过直接策略蒸馏实现从弱到强泛化
一句话结论
本研究提出 Direct On-Policy Distillation (Direct-OPD) 方法,通过在弱模型上运行强化学习(RL),然后将其 RL 引发的策略偏移(而非最终策略)作为隐式奖励信号转移到强学生模型,从而高效地实现从弱到强的泛化。
事件概述或研究问题
使用可验证奖励的强化学习(RLVR)是改进语言模型推理能力的有效策略,但将其应用于每个新的大模型成本高昂,因为目标模型在训练中需要生成大量轨迹。随着模型规模扩大,后训练本身成为计算瓶颈。本研究探索一种弱到强的替代方案:在计算成本较低的小模型上运行 RL,然后复用该 RL 运行的学习成果来改进更强的目标模型。直接蒸馏 RL 后的弱教师模型效果不足,因为其最终策略混合了有用的 RL 增益和小模型的自身局限。
方法/产品要点
- Direct On-Policy Distillation (Direct-OPD):不是直接蒸馏弱教师模型的最终策略,而是传递其 RL 引发的“策略偏移”。
- 核心机制:比较 RL 后的弱教师与其自身的 RL 前参考模型,将两者的对数比率(log-ratio)作为隐式奖励信号作用于更强学生模型的在线策略状态。
- 关键优势:直接复用弱模型的 RL 监督信号,无需训练显式奖励模型,也无需在目标模型上运行稀疏奖励的 RL。能够对多个策略偏移进行顺序组合。
主要结果或产业意义
- 实验效果显著:在 AIME 2024 数据集上,Direct-OPD 将 Qwen3-1.7B 模型的性能从 48.3% 提升至 62.4%,仅需在 8 块 A100 GPU 上训练 4 小时。
- 性能对比:该方法优于步数匹配的直接 RL 方法。
- 核心启示:强化学习的结果可以作为隐式奖励信号跨模型规模复用,而不仅仅是作为最终模型来模仿。
为什么重要
该研究提出了一种成本效益极高的模型后训练范式,解决了大语言模型训练中后训练阶段的计算瓶颈问题。通过将昂贵的小模型 RL 训练收益有效迁移到更大模型,可以在不增加强模型直接 RL 开销的情况下显著提升其推理能力,对模型能力迭代和规模化部署具有实际价值。
局限与不确定性
- 待核实:方法的理论基础或收敛性保证。
- 待核实:处理弱教师模型自身内在偏见或错误倾向的机制。
- 待核实:该方法在更广泛、更多样化的任务(例如非推理类任务)上的泛化能力。
可用于图书/PPT/简报的角度
- 成本优化视角:介绍如何用“小模型做昂贵训练,大模型直接受益”的思想降低 AI 模型升级成本。
- 技术讲解视角:解释传统知识蒸馏与“策略偏移蒸馏”的本质区别,以及隐式奖励的设计逻辑。
- 组合创新视角:展示如何像函数组合一样逐步叠加多个弱模型的 RL 学习成果,形成渐进式增强。
原始材料
- 英文标题: Weak-to-Strong Generalization via Direct On-Policy Distillation
- 英文关键词: Weak-to-Strong Generalization, Direct On-Policy Distillation, RLVR, Policy Shift, Implicit Reward
- 原始来源: arXiv:2607.05394v1, URL: https://arxiv.org/abs/2607.05394v1