AI消息速览

600倍加速,720p视频实时生成!单卡也能带的动14B模型

事件日期 2026-08-08 · 产业观察 · 已接受

事件日期2026-08-08
信息日期2026-08-08
入库日期2026-08-08
通道产业观察
状态已接受
来源新智元

知识卡片:600倍加速,720p视频实时生成!单卡也能带的动14B模型

英文标题:原文未提供;中文标题可暂译为 "600x Speedup, Real-Time 720p Video Generation: A 14B Model on a Single GPU"
英文关键词:LightX2V; LightWan2.2-A14B; Wan2.2-A14B; 4-step distillation; NVFP4 quantization; dynamic sparse attention; sequence parallelism; RTX 5090; real-time video generation
原始来源:新智元报道(AIERA 转载),发布于 2026-08-08;URL: https://aiera.com.cn/2026/08/08/other/admin/108257/600%e5%80%8d%e5%8a%a0%e9%80%9f%ef%bc%8c720p%e8%a7%86%e9%a2%91%e5%ae%9e%e6%97%b6%e7%94%9f%e6%88%90%ef%bc%81%e5%8d%95%e5%8d%a1%e4%b9%9f%e8%83%bd%e5%b8%a6%e7%9a%84%e5%8a%a814b%e6%a8%a1%e5%9e%8b

一句话结论

LightX2V 团队面向 Wan2.2-A14B 推出 LightWan2.2-A14B,通过把去噪步数从 40 步压到 4 步,并结合 NVFP4 量化、动态稀疏注意力、显存卸载和多卡序列并行,使 14B 视频生成模型能在单张 RTX 5090 上运行;8 张 RTX 5090 上生成 5 秒 720p 视频,T2V 端到端只需 3.8 秒,I2V 只需 4.5 秒。

事件概述/研究问题

14B 级视频扩散 Transformer(DiT)生成一段 5 秒 720p 视频,原本可能需要数十分钟。难点主要有两个:

  1. 生成慢:Wan2.2 通常需要 40 步去噪;随着分辨率增高、Token 序列变长,自注意力开销随序列长度平方增长。序列长度约 120K 时,自注意力可占单次 DiT 延迟的 80% 以上。
  2. 显存装不下:14B 模型权重、长视频 Token、注意力缓冲区和中间激活同时占用显存,峰值容易超过约 30GB 的消费级 GPU 容量,导致 OOM。

本文报道的 LightWan2.2-A14B,目标是让 14B 视频生成在消费级 GPU 上可运行,并让 720p 视频生成达到“5 秒视频在 5 秒内生成”的实时标准。

方法/产品要点

  • 模型/项目名称:LightWan2.2-A14B,属于 LightX2V 项目,针对 Wan2.2-A14B 优化。
  • 步数蒸馏:40 步 → 4 步
    • 采用 Phased DMD:将信噪比区间拆分为多个阶段,不同专家学习不同噪声区间内的去噪行为。
    • 引入 SGMD 加速训练:让 fake score 向 teacher score 对齐,并用 teacher stop-gradient Fisher 构建稳定的分布匹配目标。
    • 最终形成“两步高噪声专家 + 两步低噪声专家”的 4 步推理流程。
  • NVFP4 量化感知训练
    • NVFP4 采用 E2M1 4 比特数值,每 16 个连续元素共享 FP8 块级缩放,全张量配合 FP32 全局缩放。
    • 量化感知训练被融入步数蒸馏,用 CUTLASS 内核映射到 Blackwell Tensor Core,降低线性层显存流量和 GEMM 延迟。
  • 动态稀疏量化注意力
    • 用 Query/Key 块级均值快速估计注意力重要性,运行时只计算被激活的关键注意力块。
    • 典型稀疏率 80%—90%,即只保留约 10%—20% 的注意力块;并接入 SageAttention2 形成 FP8 稀疏注意力路径。
  • 高效推理算子
    • 在线性层、MLP 和 MoE 中使用双 NVFP4 Block-Scaled Tensor Core GEMM。
    • 将 3D RoPE、RMSNorm 等替换为融合内核,减少临时张量和内存往返。
  • 异步折叠 Offload
    • 提供 Block 级卸载,按 Transformer 块细粒度搬运权重,并将数据传输隐藏在计算过程中,降低峰值显存。
  • Light-Ulysses 多卡并行
    • 在 Ulysses 风格序列并行基础上,使用 FP8 通信、QKV 张量融合、Triton 前后处理融合内核、Head 级异步流水,减少通信量和同步等待。

主要结果/产业意义

场景 任务/分辨率 原 40 步模型 优化后 加速
8×RTX 5090 T2V 720p 2668 秒 3.8 秒 705.8×
8×RTX 5090 I2V 720p 原文未单列(待核实) 4.5 秒 599.3×
8×RTX 5090 I2V 480p 787 秒 2.4 秒 原文未标注加速倍数
单张 RTX 5090 T2V 720p 2668 秒 22.5 秒 118.7×
单张 RTX 5090 I2V 720p 2685 秒 26.7 秒 100.5×
单张 RTX 5090 I2V 480p 787 秒 10.7 秒 原文未标注加速倍数
  • 原文还提到:单卡 T2V 480p 加速为 80.7×,但未给出优化前后绝对时间,待核实。
  • 与同为 4 步、同为单卡的 TurboWan2.2-I2V-A14B 相比,I2V 480p 和 720p 分别约快 3.5 倍和 2.4 倍。
  • 按报道口径,8 卡 720p 的 T2V、I2V 生成时间均短于 5 秒视频的播放时长,因此称“720p 实时生成”。

为什么重要

  • 这是把“步数蒸馏、4-bit 量化、稀疏注意力、显存卸载、多卡序列并行”组合到同一条推理链路的具体工程案例。
  • 如果独立复现成立,14B 视频生成的门槛将从“多卡/数据中心”降到“单张消费级 RTX 5090”,并把 720p 生成拉入“5 秒内”实时区间。
  • 与已有相关卡片(NIST AI RMF、Epoch AI、AI 破解图论猜想)无事实重复;本条增量是具体项目名、技术路线和实测性能数字。

局限与不确定性

  • 原始页面为媒体/项目方报道,非第三方独立评测;基准环境、采样细节、评测 Prompt 等未完整公开,待核实。
  • 单卡结果基于 RTX 5090(原文提及 Blackwell Tensor Core 优化);其他消费级显卡能否运行、性能如何,原文未给出,待核实。
  • “实时”的标准是“5 秒视频端到端生成时间短于 5 秒”;更长视频、更高分辨率或复杂运动是否仍能实时,原文未系统说明,待核实。
  • 加速倍数的基线是“原始 40 步模型”,但基线模型的具体采样器、精度、是否包含模型加载或编译时间等细节未完整展开,待核实。
  • 量化与稀疏化通常可能带来画质变化;原文宣称保留运动动态、视觉细节与输出多样性,但未给出系统性画质评估指标,待核实。

可用于图书/PPT/简报的角度

  • 少算、少占、少等:视频生成模型推理优化的三条主线。
  • 从 40 步到 4 步:扩散模型蒸馏为什么能带来近百倍加速。
  • 5 秒生成 5 秒视频:什么是工程意义上的实时视频生成。
  • 从多卡到单卡:量化、稀疏注意力与 Offload 的组合拳。

原始材料

  • 原报道标题:《600倍加速,720p视频实时生成!单卡也能带的动14B模型》,新智元报道,2026-08-08。
  • 转载/收录页面:AIERA,URL: https://aiera.com.cn/2026/08/08/other/admin/108257/600%e5%80%8d%e5%8a%a0%e9%80%9f%ef%bc%8c720p%e8%a7%86%e9%a2%91%e5%ae%9e%e6%97%b6%e7%94%9f%e6%88%90%ef%bc%81%e5%8d%95%e5%8d%a1%e4%b9%9f%e8%83%bd%e5%b8%a6%e7%9a%84%e5%8a%a814b%e6%a8%a1%e5%9e%8b
  • 项目地址:https://github.com/ModelTC/LightX2V
  • 模型地址:https://huggingface.co/lightx2v/LightWan2.2-A14B
  • 项目博客:https://light-ai.top/LightX2V-BLOG/posts/LightWan22-A14B/
  • 原文引用论文:Phased DMD(CVPR 2026);SGMD(ICML 2026)。