知识卡片:顺序优于联合——在线策略蒸馏与 RLVR 的相互作用
- 英文标题:Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR
- 英文关键词:on-policy distillation; RLVR; reasoning LLMs; post-training; foundation-model
- 原始来源:https://arxiv.org/abs/2609.04108v1
一句话结论
在推理大语言模型(LLM)后训练中,简单两阶段方案“先在线策略蒸馏,后基于可验证奖励的强化学习”(OPD-then-RL)在逻辑与数学推理基准上一致优于纯 OPD、纯 RLVR,也优于把二者在单步内联合优化的既有基线;机制解释是:OPD 扩展学生对教师支持解的覆盖,RLVR 在该覆盖内锐化,而联合优化两个信号会造成相互干扰。
事件概述或研究问题
- RLVR 与 OPD 已被视为推理 LLM 后训练的两大主流方法。先前工作通常用 OPD 的稠密 token 级监督来补充 RLVR 的稀疏奖励,并将两个信号在同一个训练步骤内融合。
- 既有融合方式主要包括“加权相加组合”和“教师调制重标定 RL 优势”。
- 本文的研究问题是:把两个信号改成“顺序分阶段”使用,是否比“单步联合优化”更好?联合优化为何会出问题?
方法/产品要点
- 提出 OPD-then-RL:先执行在线策略蒸馏,再执行 RLVR。
- OPD 阶段:扩展学生模型对“教师支持的解题路径/解空间”的覆盖。
- RL 阶段:在学生已经覆盖到的那部分空间内进行锐化和精炼。
- 切换信号:作者发现 OPD 验证分数是决定何时从 OPD 切到 RL 的关键信号。
- 冷启动:OPD 作为 RL 的冷启动优于 SFT。
- 解释工具:pass@k 行为、学习动态、参数更新。
主要结果或产业意义
- OPD-then-RL 在逻辑与数学推理基准上,系统性地胜过纯 OPD、纯 RLVR,以及所有此类“单步联合”基线。
- 结果支持一个清晰机制:OPD 负责扩大覆盖,RL 负责在覆盖内锐化;二者适合被设计为互补的阶段,而不是纠缠在同一目标中的两个信号。
- 从实践角度看,该方案提供了一个更简单的强基线:无需设计复杂的信号融合方式,只需用 OPD 验证分数决定切换时机。
为什么重要
- 它挑战了“OPD 稠密监督 + RL 稀疏奖励必须同时优化”的默认思路,指出训练信号的先后顺序可能比融合方式更重要。
- 为 OPD 与 RLVR 的关系提供了增量理解:OPD 不只是 RL 的辅助正则项,还是比 SFT 更好的 RL 冷启动。
- 为后训练 pipeline 给出一个易用的操作配方:先蒸馏,再看 OPD 验证分数,再切换到 RL。
与既有脉络的关系
本条延续“在线策略蒸馏(OPD)用于推理模型后训练”的研究脉络,但增量信息不在 OPD 内部的教师纠错或多教师搭配,而在其与 RLVR 的顶层时序安排。与 Relay-OPD 关注教师接力、Open-MOPD 关注多教师能力失衡不同,本文的核心增量是:“顺序式两阶段(OPD-then-RL)优于单步联合优化”,且 OPD 验证分数是切换阶段的关键信号。
局限与不确定性
- 当前材料仅为 arXiv 摘要,未提供具体逻辑/数学基准名称、模型规模、数据集规模和提升幅度;这些内容均有待核实。
- “覆盖扩展—锐化—干扰”的解释是作者基于 pass@k、学习动态和参数更新给出的概括;具体测量方式和实验证据需要查阅全文。
- 关于“所有此类联合基线”的具体构成、调参成本、以及 OPD 验证分数的阈值设定,均需要原文确认。
- 该版本为 arXiv v1 预印本;是否经过同行评审无法从现有材料确认。
可用于图书/PPT/简报的角度
- 后训练不一定是“同时做加法”:把 OPD 和 RLVR 变成先后两个阶段,可能比单步混合更有效。
- 一句话意象:OPD 负责“铺路”,RL 负责“精修”;同时推两个信号反而会互相干扰。
- 实用启示:如果团队已经做了 OPD,不必急着把 RL 损失加进去,可以观察 OPD 验证分数,再切换到 RLVR。
- OPD 可以作为比 SFT 更好的 RL 冷启动,这是训练流程设计上的直接参考点。
原始材料
- 英文标题:Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR
- 作者:Boyan Li, Bingsen Chen, Chenghao Yang, Ping Nie, Chen Zhao, Xi Ye
- arXiv ID:2609.04108v1
- 分类:cs.CL, cs.AI, cs.LG
- 发布时间/更新时间:2026-09-03
- URL:https://arxiv.org/abs/2609.04108v1
- PDF:https://arxiv.org/pdf/2609.04108v1