AI消息速览

MV-Forcing:基于4D几何的时空自强迫长多视角视频生成

事件日期 2026-07-06 · 学术前沿 · 已接受

事件日期2026-07-06
信息日期2026-07-06
入库日期2026-07-07
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:MV-Forcing:基于4D几何的时空自强迫长多视角视频生成

英文标题: MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing
英文关键词: video diffusion models, multi-view video generation, 4D geometry, autoregression, distribution matching distillation

一句话结论

MV-Forcing 是一个结合时间与视角双向自回归的框架,通过引入4D几何桥接,使单个扩散模型能够生成任意长度、多视角一致的动态场景视频,并利用分布匹配蒸馏(DMD)与时空自强迫缩小训练与推理之间的曝光偏差。

事件概述或研究问题

现有视频扩散模型要么通过时间自回归生成长单视角视频,要么通过双向注意力合成短多视角视频,但生成长且多视角一致的动态场景视频仍未解决。MV-Forcing 旨在解决这一空白。

方法/产品要点

  1. 4D几何桥接:在顺序生成的视图之间,使用自回归3D重建模型从已完成的源视图重建3D结构,并渲染出下一个目标视角的几何先验,再由扩散模型精化为高质量视频。
  2. 联合去噪训练:训练时将两个视图槽(view slots)都从噪声初始化,从而突破教师模型固定的时间窗口,实现时间上无界生成。
  3. 分布匹配蒸馏(DMD)与时空自强迫:通过自强迫机制同时处理时间和视角两个维度的自回归,弥合训练与推理时的曝光偏差;最终得到只需少数几步推理的学生模型。

主要结果或产业意义

在合成数据和真实数据上的大量实验表明,MV-Forcing 能够使用单个少步学生模型生成几何一致的多视角动态场景视频,且视频长度和视角数量可任意指定。产业意义:待核实(可能对影视制作、虚拟现实、自动驾驶场景生成等领域有潜在价值)。

为什么重要

解决了长期存在于视频生成领域的一个难题:如何同时保证时间上的长程连贯性与空间上多视角的几何一致性。MV-Forcing 通过将3D重建模型自然嵌入生成流程,为这类任务提供了一种可扩展的、无需额外配对数据的框架。

局限与不确定性

待核实(原文未明确提及局限性,可能包括对复杂动态场景的泛化能力、计算开销、蒸馏后学生模型的精度损失等)。

可用于图书/PPT/简报的角度

  • 技术讲座:介绍如何结合自回归和扩散模型实现长视频生成。
  • 计算机视觉前沿:展示4D几何先验在视频生成中的桥梁作用。
  • 创业/产品:描绘“任意视角、任意时长动态场景一键生成”的可能性。

原始材料

  • arXiv ID: 2607.05376v1
  • URL: https://arxiv.org/abs/2607.05376v1
  • 作者: Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim
  • 发表时间: 2026-07-06
  • 摘要原文:

    Recent advances in video diffusion models have enabled either long single-view generation through temporal autoregression, or short multi-view synthesis through bidirectional attention. However, generating long, multi-view consistent videos of dynamic scenes remains unsolved. In this work, we present MV-Forcing, a framework that composes temporal and view-wise autoregression within a single diffusion model by introducing a 4D geometric bridge between sequentially generated views. ... Extensive experiments on both synthetic and real-world data demonstrate that MV-Forcing produces geometrically consistent multi-view videos of dynamic scenes at arbitrary lengths and viewpoint counts using a single few-step student model.