AI消息速览

并行解码蒸馏:面向快速图像与视频生成的轨迹式蒸馏方法

事件日期 2026-07-20 · 学术前沿 · 已接受

事件日期2026-07-20
信息日期2026-07-28
入库日期2026-07-29
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:并行解码蒸馏:面向快速图像与视频生成的轨迹式蒸馏方法

  • 一句话结论:该论文提出一种名为并行解码蒸馏(PDD)的简化、可扩展的轨迹蒸馏方法,在4–8次函数评估(NFE)下达到当前最优性能,并显著提升生成视频的多样性。

事件概述 / 研究问题

现有视频扩散或流模型因迭代采样过程缓慢而计算成本高;当前最优加速方法(如变分分数蒸馏VSD、对抗损失)难以优化且易出现模式崩溃,导致视频多样性丧失和运动缺失。本文旨在提出一种更简化、可扩展的蒸馏方法,以支持多种预训练模型并实现不同NFE的快速推理。

方法 / 产品要点

  • 方法名称:Parallel Decoding Distillation (PDD) —— 并行解码蒸馏。
  • 核心思想:通过单次网络评估预测多个去噪步骤,从而加速生成。从概念上学习平均速度的表示,而无需使用JVPs(雅可比向量积)或有限差分近似来回归其导数。
  • 兼容性:与任意预训练模型兼容,支持可变NFE的采样。
  • 训练方式:基于轨迹的蒸馏,无需依赖VSD或对抗损失,避免其优化困难与模式崩溃问题。

主要结果 / 产业意义

  • 性能:在LTX-2.3文本到视频/音频、Wan 14B文本到视频、Qwen-Image文本到图像任务上,使用4–8 NFE即达到当前最优(SOTA)性能。
  • 多样性提升:PDD在生成视频多样性方面有显著改善。

为什么重要

  • 解决了现有蒸馏方法优化困难、易模式崩溃的问题,提供了一种更稳定、可扩展的加速方案。
  • 支持多种预训练模型和可变NFE,实用性强,有助于推动视频生成模型在实际应用中的部署。
  • (与既有脉络关系:不同于FlowMimic等侧重编辑或数据生成的方法,PDD专注于模型推理加速,并特别强调多样性提升这一增量信息。)

局限与不确定性

  • 由于无法获取原文正文,以下信息待核实:
    • 具体的算法细节(如并行解码步骤的实现方式、损失函数设计)。
    • 与现有蒸馏方法(如VSD、对抗蒸馏)的定量对比(除性能指标外)。
    • 在更长视频生成(如超过数十帧)或更高分辨率下的表现。
    • 训练所需的计算资源与时间成本。
    • 是否支持除文本到视频/图像外的其他条件(如图像到视频)。

可用于图书 / PPT / 简报的角度

  • 技术前沿:大模型加速领域的新方法,可对比传统蒸馏与PDD的优劣。
  • 产业应用:未来实现实时视频生成的关键技术之一,适合作为AI生成内容(AIGC)实例。
  • 方法论创新:展示如何通过并行预测多步来压缩推理链,启发其他模态的加速方案。

原始材料

  • URL: https://arxiv.org/abs/2607.26004v1
  • 英文标题: Parallel Decoding Distillation for Fast Image and Video Generation
  • 关键词: foundation-model; video diffusion; distillation; acceleration; trajectory-based
  • 来源: arXiv preprint (2026-07-20)