知识卡片:DASH:面向同策略自蒸馏推理模型的散度自适应监督视野
英文标题:DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models
英文关键词:DASH; Divergence-Adaptive Supervision Horizons; On-Policy Self-Distillation; RLVR; Mathematical Reasoning
原始来源:https://arxiv.org/abs/2608.06243v1
一句话结论
DASH 提出在标准同策略自蒸馏(OPSD)的逐 token 监督中引入“散度自适应传播门”,根据局部散度相对序列均值的偏差动态调整反向多步聚合,从而在不增加任何 teacher/student 前向计算的情况下,在 3 个数学推理基准、3 个模型规模上一致优于 vanilla OPSD。
事件概述或研究问题
带可验证奖励的强化学习(RLVR)能提升大模型推理能力,但奖励信号通常是序列级的、稀疏的。OPSD 通过查询特权教师模型,在 student 访问过的前缀上提供稠密的 token 级分布监督,缓解了信号稀疏问题。
然而,DASH 的作者发现标准 OPSD 仍有不足:它给每个局部散度分配相同的系数,忽略了 rollout 的时间结构。在自回归生成中,相同的散度大小可能处于不同的“散度历史”之后,反映 teacher 与 student 之间不一致的不同演化路径;仅靠局部标量无法区分这些时序上下文,导致 token 级权重不能随实际散度序列自适应调整。
方法/产品要点
- 核心机制:将每个局部蒸馏信号与序列级均值的差距映射为自适应传播门(adaptive propagation gate)。
- 利用这些门控制反向多步聚合,使得 token 级监督权重能够根据生成过程中局部散度的演化方式进行调整。
- 完全复用 OPSD 已经计算出的 teacher 与 student 分布,不需要额外的 teacher 或 student 前向传播。
- 代码已开源:https://github.com/DBtxy/DASH-OPSD
主要结果或产业意义
- 在 3 个数学推理基准、3 个模型规模上,DASH 在每一个基准、每一个规模上都优于匹配的 vanilla OPSD 重跑实验。
- 具体基准名称、模型规模、提升幅度、与更广泛基线的对比等细节,摘要中未提供,待核实。
- 产业意义:DASH 提供了一种轻量、无需额外推理开销即可改进自蒸馏训练的思路,适合作为推理模型训练流程中的插件式改进。
为什么重要
OPSD 类方法此前主要关注如何提供稠密监督(如借助特权教师、构造伪解、定位推理支点),而 DASH 首次明确指出现有 OPSD 忽略了“散度的时间演化”这一维度,并给出了一个计算开销极小的解决方案。它提示:在序列级强化学习信号被稠密化之后,如何根据生成历史动态调整监督强度,仍是值得继续挖掘的方向。
局限与不确定性
- 摘要仅报告了相对 vanilla OPSD 的改进,未给出与 RLVR/GRPO、RP-OPSD、U-OPSD 等其他方法的系统比较,待核实。
- 未说明在非数学推理任务上是否有效。
- 未说明传播门的超参数敏感性、训练稳定性、额外内存/时间开销等细节,待核实。
- 论文为 arXiv 预印本(2608.06243v1),尚未提供完整实验设置与消融,部分结论需以全文为准。
与既有脉络的关系
已有卡片中的 RP-OPSD 用“推理支点”引导同策略自蒸馏,U-OPSD 用模型自身一致性构造伪解;DASH 则直接改进标准 OPSD 的监督加权机制,强调散度序列的时序上下文。三者属于同一 OPSD 技术脉络中的不同改进维度:DASH 的增量信息是“局部散度相对序列均值的位置差异应被建模为自适应传播门”。
可用于图书/PPT/简报的角度
- 讲解 RLVR 稀疏奖励问题时,可引用 DASH 作为“稠密化之后还要考虑时间结构”的典型案例。
- 介绍推理模型自蒸馏训练时,可展示从“序列级奖励”到“token 级稠密监督”再到“时序自适应权重”的演进逻辑。
- 强调“零额外前向计算”的收益,说明有时改进来自对已有信息的重新聚合,而非增加模型容量或计算量。
原始材料
- 英文标题:DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models
- arXiv ID:2608.06243v1
- 作者:ZhiYan Hou, Xinyu Tang, Hongyan An, Jianjin Zhang, Weizhen Wang, Yunyun Han, Gengsheng Li, Xiangzhao Hao, Haiyun Guo, Wenbin Hu, Jinqiao Wang, Yafeng Deng
- 提交/更新日期:2026-08-06
- 分类:cs.AI
- 代码:https://github.com/DBtxy/DASH-OPSD
- URL:https://arxiv.org/abs/2608.06243v1