AI消息速览

无监督同策略自蒸馏(U-OPSD)

事件日期 2026-08-06 · 学术前沿 · 已接受

事件日期2026-08-06
信息日期2026-08-06
入库日期2026-08-08
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:无监督同策略自蒸馏(U-OPSD)

一句话结论

仅利用模型自身多次生成的内部一致性,就能实现同策略自蒸馏:U-OPSD 在不使用地面真值、环境反馈或更大模型指导的情况下,用多数投票构造伪解并蒸馏到模型自己的最长错误补全前缀,在数学推理基准上与使用 ground truth 的 OPSD/GRPO 相当或更优。

事件概述或研究问题

OPD/OPSD 一类方法在 LLM 后训练中展现出很大潜力,但现有方法仍依赖外部监督,包括 ground-truth 信号、环境反馈或更大模型指导,因此算不上真正的“自我蒸馏”。本文提出 U-OPSD,研究是否只靠模型自身生成和内部一致性即可完成同策略自蒸馏。

方法/产品要点

  • 先从当前模型采样多条 rollout。
  • 在“自一致性阈值”下对多条结果进行多数投票,构造伪解(pseudo-solution)。
  • 以最短伪解为条件构造教师分布。
  • 将该教师分布蒸馏到模型自身“最长错误补全”的前缀上,使模型在它“自信但错误”的位置进行自我纠正。
  • 整个过程不借助任何外部监督;具体“错误”判定和阈值设定细节待核实。

主要结果或产业意义

  • 在 AIME24、AIME25、HMMT25、MATH500、AMC23 上,Qwen3 非思考模式 4B/8B 相对基线的提升分别为 8.5% 和 10.7%;相对 OPSD 平均提升 3.2% 和 2.3%。
  • 思考模式下,U-OPSD 与 OPSD 基本相当:4B 上高出 0.9%,8B 上持平;同时超过 GRPO 0.7%(4B)和 1.1%(8B)。
  • 材料称在多种基准、基座模型和训练设置下,U-OPSD 一致优于基座模型,并能匹配或超过使用 ground truth 的监督方法。
  • 产业意义:可能减少后训练阶段对人工标注或奖励模型的依赖,使无标注环境中的推理模型自我提升成为可能。

为什么重要

  • 把“自我蒸馏”真正推向无监督:教师信号来自模型自身的一致性,而不是外部特权信息。
  • 对缺少 ground truth 或环境奖励的场景,如开放性推理、领域自适应,有潜在价值。
  • 提示“自信但错误”的位置可以通过内部一致性自动定位,从而进行自我纠正,而不需要外部告诉它答案是否正确。

与既有脉络的关系

已有相关卡片 OPD-V、RP-OPSD、DemoPSD 分别处理视觉语言模态平衡、多语言推理支点、分歧调制等问题,但仍涉及模态特权信息、英文参考或选择性教师等额外信号。U-OPSD 的增量在于:完全去掉外部监督,只依赖模型自身生成与内部一致性,是无监督版本的 OPSD。

局限与不确定性

  • 目前仅基于 arXiv 摘要,完整训练/推理细节未确认。
  • 采样次数、自一致性阈值、“最短伪解”和“最长错误补全”的判定标准、错误定义等均为待核实。
  • 报告中的 8.5%、10.7% 等提升是平均口径还是各基准单独结果、是否有显著性检验,待核实。
  • 除 Qwen3 4B/8B 外,其他“diverse base models”和任务类型未在摘要中列举,待核实。
  • 未提供计算开销、训练步数、代码或复现信息,待核实。

可用于图书/PPT/简报的角度

  • “无监督自蒸馏:让模型用自己的多数票当老师。”
  • “从外部监督到内部一致性:LLM 后训练的新信号。”
  • “没有标准答案也能自我改进:U-OPSD 的数学推理实验。”
  • “讨论题:模型能否可靠地知道自己‘自信但错误’?”

原始材料

  • 英文标题:On-Policy Self-Distillation without Any Supervision
  • 英文关键词:foundation-model; on-policy self-distillation; unsupervised; self-consistency; LLM post-training
  • Track: academic
  • Topics: foundation-model
  • 作者:Yijiang Li, Bingyang Wang, Yijun Liang, Yunjie Tian, Di Fu, Nuno Vasconcelos
  • arXiv ID:2608.06296v1
  • 分类:cs.LG
  • 发布/更新:2026-08-06T17:18:23Z
  • 原始来源:https://arxiv.org/abs/2608.06296v1
  • PDF:https://arxiv.org/pdf/2608.06296v1