AI消息速览

视觉对比自蒸馏(VCSD)

事件日期 2026-07-23 · 学术前沿 · 已接受

事件日期2026-07-23
信息日期2026-07-23
入库日期2026-07-24
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:视觉对比自蒸馏(VCSD)

英文标题: Visual Contrastive Self-Distillation
英文关键词: on-policy self-distillation, visual contrastive self-distillation, VCSD, EMA teacher, content-erased control, ViRL39K, Qwen3-VL
原始来源: https://arxiv.org/abs/2607.21556v1


一句话结论

VCSD 通过将图像内容擦除转化为对比信号,在不依赖外部教师、特权答案或视觉证据的前提下,实现了性能优于现有策略自蒸馏的纯输入条件驱动的自蒸馏方法,并在 Qwen3‑VL 系列上取得显著提升。

研究问题

策略自蒸馏(OPSD)消除了对蒸馏所需的外部教师模型,但仍须在教师与学生之间制造信息不对称,以确保自教师提供比学生更强的学习信号。现有方法通过特权答案或视觉证据实现这种不对称。本研究探讨能否同时移除这两者,仅通过输入条件驱动 OPSD。

方法/产品要点

  • 核心思想:将图像内容移除转化为 on-policy 自蒸馏信号。
  • 具体流程:在每一步学生生成的前缀上,EMA 教师同时生成两个下一 token 分布:一个以原始图像为条件,另一个以内容擦除的控制图像为条件。
  • 对比机制:计算两个分布逐 token 的 log‑概率差,差值突出那些因实例级视觉内容而概率显著提高的候选 token。
  • 蒸馏目标:利用该对比结果锐化教师基于原始图像的分布(在其合理支持范围内),将锐化后的全分布作为目标蒸馏给学生。
  • 优势:无需外部教师、特权答案、视觉证据信号、推理轨迹,且推理阶段无额外开销。

主要结果

  • 数据集:ViRL39K。
  • 模型:Qwen3‑VL 和 Qwen3.5 系列。
  • 七项基准聚合结果(Qwen3‑VL)
    • 2B:62.27% → 67.04%(+4.77pp)
    • 4B:71.30% → 73.16%(+1.86pp)
    • 8B:72.51% → 76.26%(+3.75pp)
  • 一致结论:VCSD 在所有规模和模型变体上均优于匹配的 OPSD 基线。

为什么重要

  • 在策略自蒸馏方向上首次验证了仅靠输入条件(图像内容擦除对比)即可提供足够的自教师信号,简化了 OPSD 的设置。
  • 与已有卡片中 DemoPSD(通过分歧调制解决特权泄露)相比,VCSD 从不同角度(对比擦除信号)进一步降低了不对称信息的依赖,带来了额外的简化。
  • 性能提升可观且无推理成本增加,具有实际部署价值。

局限与不确定性

  • 材料未讨论 VCSD 在其他视觉‑语言模型族(如 LLaVA、InternVL)上的泛化表现。
  • 内容擦除的具体实现方式对结果的影响、不同擦除强度的鲁棒性等细节待核实。
  • 是否适用于纯文本或非视觉任务尚未涉及。

可用于图书/PPT/简报的角度

  • 技术演进图:从有外部教师的知识蒸馏 → 无外部教师的自蒸馏(OPSD)→ 去特权/视觉证据的纯输入驱动自蒸馏(VCSD)。
  • 对比机制可视化:展示同一前缀下原始图像与擦除控制图像的分布差异如何被 log‑概率差捕捉。
  • 实验亮点:以 Qwen3‑VL 2B 提升近 5 个百分点为例,强调简化带来的收益。

原始材料

  • 论文标题:Visual Contrastive Self-Distillation
  • 作者:Yijun Liang, Yunjie Tian, Yijiang Li, Yuqi Jia, Furong Huang, Tianyi Zhou, Di Fu
  • arXiv 编号:2607.21556v1
  • 摘要及全文链接:https://arxiv.org/abs/2607.21556v1