知识卡片:MV-Forcing:基于4D几何的时空自强迫长多视角视频生成
英文标题: MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing
英文关键词: video diffusion models, multi-view video generation, 4D geometry, autoregression, distribution matching distillation
一句话结论
MV-Forcing 是一个结合时间与视角双向自回归的框架,通过引入4D几何桥接,使单个扩散模型能够生成任意长度、多视角一致的动态场景视频,并利用分布匹配蒸馏(DMD)与时空自强迫缩小训练与推理之间的曝光偏差。
事件概述或研究问题
现有视频扩散模型要么通过时间自回归生成长单视角视频,要么通过双向注意力合成短多视角视频,但生成长且多视角一致的动态场景视频仍未解决。MV-Forcing 旨在解决这一空白。
方法/产品要点
- 4D几何桥接:在顺序生成的视图之间,使用自回归3D重建模型从已完成的源视图重建3D结构,并渲染出下一个目标视角的几何先验,再由扩散模型精化为高质量视频。
- 联合去噪训练:训练时将两个视图槽(view slots)都从噪声初始化,从而突破教师模型固定的时间窗口,实现时间上无界生成。
- 分布匹配蒸馏(DMD)与时空自强迫:通过自强迫机制同时处理时间和视角两个维度的自回归,弥合训练与推理时的曝光偏差;最终得到只需少数几步推理的学生模型。
主要结果或产业意义
在合成数据和真实数据上的大量实验表明,MV-Forcing 能够使用单个少步学生模型生成几何一致的多视角动态场景视频,且视频长度和视角数量可任意指定。产业意义:待核实(可能对影视制作、虚拟现实、自动驾驶场景生成等领域有潜在价值)。
为什么重要
解决了长期存在于视频生成领域的一个难题:如何同时保证时间上的长程连贯性与空间上多视角的几何一致性。MV-Forcing 通过将3D重建模型自然嵌入生成流程,为这类任务提供了一种可扩展的、无需额外配对数据的框架。
局限与不确定性
待核实(原文未明确提及局限性,可能包括对复杂动态场景的泛化能力、计算开销、蒸馏后学生模型的精度损失等)。
可用于图书/PPT/简报的角度
- 技术讲座:介绍如何结合自回归和扩散模型实现长视频生成。
- 计算机视觉前沿:展示4D几何先验在视频生成中的桥梁作用。
- 创业/产品:描绘“任意视角、任意时长动态场景一键生成”的可能性。
原始材料
- arXiv ID: 2607.05376v1
- URL: https://arxiv.org/abs/2607.05376v1
- 作者: Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim
- 发表时间: 2026-07-06
- 摘要原文:
Recent advances in video diffusion models have enabled either long single-view generation through temporal autoregression, or short multi-view synthesis through bidirectional attention. However, generating long, multi-view consistent videos of dynamic scenes remains unsolved. In this work, we present MV-Forcing, a framework that composes temporal and view-wise autoregression within a single diffusion model by introducing a 4D geometric bridge between sequentially generated views. ... Extensive experiments on both synthetic and real-world data demonstrate that MV-Forcing produces geometrically consistent multi-view videos of dynamic scenes at arbitrary lengths and viewpoint counts using a single few-step student model.