SANA-Video 2.0 通过混合线性‑softmax 注意力与块注意力残差,在单 GPU 上生成 720p 视频,质量媲美全 softmax 视频 DiT,推理速度比同规模全 softmax 基线快 3.2 倍,并借助 Sol-Engine 优化实现 120 倍于 Wan 2.2-A14B 的加速。
视频扩散 Transformer 的全局注意力计算复杂度随序列长度平方增长,限制了长视频、高分辨率的生成效率。现有线性注意力虽能实现 O(N) 缩放,但缺乏全秩令牌交互,导致表达能力下降。SANA-Video 2.0 提出一种混合注意力框架,在保持线性注意力长序列优势的同时恢复 softmax 级表达力,并探索如何通过注意力残差跨深度传播优质表示。