知识卡片:DemoPSD:分歧调制的策略自蒸馏
英文标题: DemoPSD: Disagreement-Modulated Policy Self-Distillation
英文关键词: on-policy self-distillation, privileged information leakage, reverse-KL barycenter, exploration preservation, LLM reasoning
原始来源: arXiv:2607.02502v1 (https://arxiv.org/abs/2607.02502v1)
一句话结论
DemoPSD 通过引入分歧调制的选择性教师指导(反向 KL 重心目标),有效缓解了策略自蒸馏中的特权信息泄露问题,同时保留了模型的探索能力,在科学推理任务上优于 GRPO 和 SDPO。
事件概述 / 研究问题
在训练大型语言模型(LLM)进行推理时,同策略自蒸馏(OPSD)允许同一个模型同时充当教师和学生(不同信息访问级别)。然而,教师基于特权信息产生的密集逐 token 监督可能导致:过拟合领域内模式、抑制探索、损害跨领域泛化,以及更根本的特权信息泄露——学生编码了在测试时不可用的答案依赖捷径。
方法 / 产品要点
- 核心思想:选择性采纳教师指导,而非拟合完整教师分布。
- 具体目标:将学生导向一个 反向 KL 重心目标(reverse-KL barycenter target),即教师分布与学生分布的加权几何组合,平衡从教师学习与保持自身推理能力。
- 自适应混合:通过测量教师与学生分布之间的差异(分歧),在每个 token 位置自适应地控制混合程度。
- 理论保证:证明 DemoPSD 可实现(1)泄露衰减(有效缓解特权信息泄露);(2)探索保留(在密集逐 token 蒸馏下保持探索能力)。
主要结果或产业意义
- 在科学推理基准 SciKnowEval(覆盖四个科学领域)上的广泛实验表明,DemoPSD 优于 GRPO 和 SDPO。
- 同时保持更高的训练熵,并稳健地泛化到分布外基准 GPQA。
为什么重要
特权信息泄露是自蒸馏方法中一个隐蔽但严重的问题,会导致模型在推理时依赖虚假捷径,降低泛化能力。DemoPSD 首次从理论上和实验上系统解决了该问题,为 LLM 推理训练提供了更可靠的范本。
局限与不确定性
- 论文仅基于 SciKnowEval 和 GPQA 进行实验,在其他任务和领域的表现待验证。
- 自适应混合的具体计算开销(例如每 token 分歧度量)未在材料中详细说明。
- 作者未提及该方法在大规模多轮对话、代码生成等复杂场景下的效果。
可用于图书 / PPT / 简报的角度
- 比喻:教师不是全知全能的向导,而是有时需要“放手”才让学生学得更好——DemoPSD 类似于在教学中选择性提供答案。
- 对比:传统自蒸馏像“照单全收的模仿”,DemoPSD 像“有判断力的借鉴”。
- 可视化:展示教师分布、学生分布以及反向 KL 重心目标的几何关系图。
- 价值:对负责任地训练推理模型具有启发意义——避免模型学习到“作弊”策略。
原始材料
- 论文标题:DemoPSD: Disagreement-Modulated Policy Self-Distillation
- arXiv ID:2607.02502v1
- 作者:Yunhe Li, Hao Shi, Wenhao Liu, Mengzhe Ruan, Hanxu Hou, Zhongxiang Dai, Shuang Qiu, Linqi Song
- 发布时间:2026-07-02
- 类别:cs.LG, cs.AI
- 摘要 URL:https://arxiv.org/abs/2607.02502v1
- PDF URL:https://arxiv.org/pdf/2607.02502v1