AI消息速览

DemoPSD:分歧调制的策略自蒸馏

事件日期 2026-07-02 · 学术前沿 · 已接受

事件日期2026-07-02
信息日期2026-07-02
入库日期2026-07-07
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:DemoPSD:分歧调制的策略自蒸馏

英文标题: DemoPSD: Disagreement-Modulated Policy Self-Distillation
英文关键词: on-policy self-distillation, privileged information leakage, reverse-KL barycenter, exploration preservation, LLM reasoning
原始来源: arXiv:2607.02502v1 (https://arxiv.org/abs/2607.02502v1)

一句话结论

DemoPSD 通过引入分歧调制的选择性教师指导(反向 KL 重心目标),有效缓解了策略自蒸馏中的特权信息泄露问题,同时保留了模型的探索能力,在科学推理任务上优于 GRPO 和 SDPO。

事件概述 / 研究问题

在训练大型语言模型(LLM)进行推理时,同策略自蒸馏(OPSD)允许同一个模型同时充当教师和学生(不同信息访问级别)。然而,教师基于特权信息产生的密集逐 token 监督可能导致:过拟合领域内模式、抑制探索、损害跨领域泛化,以及更根本的特权信息泄露——学生编码了在测试时不可用的答案依赖捷径。

方法 / 产品要点

  • 核心思想:选择性采纳教师指导,而非拟合完整教师分布。
  • 具体目标:将学生导向一个 反向 KL 重心目标(reverse-KL barycenter target),即教师分布与学生分布的加权几何组合,平衡从教师学习与保持自身推理能力。
  • 自适应混合:通过测量教师与学生分布之间的差异(分歧),在每个 token 位置自适应地控制混合程度。
  • 理论保证:证明 DemoPSD 可实现(1)泄露衰减(有效缓解特权信息泄露);(2)探索保留(在密集逐 token 蒸馏下保持探索能力)。

主要结果或产业意义

  • 在科学推理基准 SciKnowEval(覆盖四个科学领域)上的广泛实验表明,DemoPSD 优于 GRPOSDPO
  • 同时保持更高的训练熵,并稳健地泛化到分布外基准 GPQA

为什么重要

特权信息泄露是自蒸馏方法中一个隐蔽但严重的问题,会导致模型在推理时依赖虚假捷径,降低泛化能力。DemoPSD 首次从理论上和实验上系统解决了该问题,为 LLM 推理训练提供了更可靠的范本。

局限与不确定性

  • 论文仅基于 SciKnowEval 和 GPQA 进行实验,在其他任务和领域的表现待验证。
  • 自适应混合的具体计算开销(例如每 token 分歧度量)未在材料中详细说明。
  • 作者未提及该方法在大规模多轮对话、代码生成等复杂场景下的效果。

可用于图书 / PPT / 简报的角度

  • 比喻:教师不是全知全能的向导,而是有时需要“放手”才让学生学得更好——DemoPSD 类似于在教学中选择性提供答案。
  • 对比:传统自蒸馏像“照单全收的模仿”,DemoPSD 像“有判断力的借鉴”。
  • 可视化:展示教师分布、学生分布以及反向 KL 重心目标的几何关系图。
  • 价值:对负责任地训练推理模型具有启发意义——避免模型学习到“作弊”策略。

原始材料

  • 论文标题:DemoPSD: Disagreement-Modulated Policy Self-Distillation
  • arXiv ID:2607.02502v1
  • 作者:Yunhe Li, Hao Shi, Wenhao Liu, Mengzhe Ruan, Hanxu Hou, Zhongxiang Dai, Shuang Qiu, Linqi Song
  • 发布时间:2026-07-02
  • 类别:cs.LG, cs.AI
  • 摘要 URL:https://arxiv.org/abs/2607.02502v1
  • PDF URL:https://arxiv.org/pdf/2607.02502v1