AI消息速览

WorldDirector:构建具有持久动态记忆的可控世界模拟器

事件日期 2026-07-07 · 学术前沿 · 已接受

事件日期2026-07-07
信息日期2026-07-07
入库日期2026-07-07
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:WorldDirector:构建具有持久动态记忆的可控世界模拟器

一句话结论
WorldDirector 通过将语义运动编排与视觉生成解耦,并利用大语言模型协调3D轨迹与相机运动,实现了对复杂、长时间视频事件的高可控性生成,且能保持动态物体在长时间离场后重新出现时的外观一致性。

事件概述或研究问题
现有世界模型通常将物理动态与像素渲染混为一体,依赖连续视觉观察来维持运动,导致难以控制长时间视频中的物体外观稳定性和物理逻辑。研究提出如何构建一个既能实现自由视角探索、又能保持动态物体持久记忆的高度可控视频世界模型。

方法/产品要点

  • 显式解耦:将语义运动编排(由LLM协调3D轨迹与相机运动)与视觉生成分离。
  • 使用大语言模型(LLM)作为控制信号的协调器,生成轨迹序列。
  • 将编排好的轨迹作为视频生成的控制信号,确保物理逻辑严谨和外观稳定。
  • 支持动态实体在长时间离开视野后重新进入时仍能保持精确的视觉身份。

主要结果或产业意义
实验表明,该方法能够合成复杂且延长时间跨度的事件,具备前所未有的可控性和持久动态物体记忆。这项技术有望应用于虚拟现实、电影特效、游戏场景生成、自动驾驶仿真等需要长时间、多视角视频内容且要求物体一致性控制的领域。

为什么重要
解决了现有世界模型在长时间视频生成中动态物体“遗忘”外观、运动不连续、难以自由控制视角的瓶颈,将大语言模型的推理能力与视频生成结合,为构建真正可交互、可重用的世界模拟器提供了新范式。

局限与不确定性

  • 论文未提供与现有方法(如基于扩散的世界模型)在定量指标上的完整对比数据,需待核实。
  • 模型对长视频中物体交互的物理细节(如碰撞、变形)是否完全准确,待进一步验证。
  • 对复杂场景中多物体同时管理时的计算消耗与稳定性,待核实。

可用于图书/PPT/简报的角度

  • 技术突破:解耦运动编排与视觉生成,用LLM做“导演”控制3D轨迹。
  • 行业应用:游戏关卡自动生成、虚拟制片中的角色与场景一致性控制。
  • 未来方向:将大模型作为交互式世界模拟器的核心控制器,推动具身智能仿真。
  • 类比:类似给视频生成模型安装了一个“记忆硬盘”,物体离场后回来依然认得。

原始材料

  • URL: https://arxiv.org/abs/2607.02517v1
  • 英文标题: WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory
  • 英文关键词: foundation-model, world model, controllable video generation, persistent memory, LLM trajectory coordination
  • 来源: Hanlin Wang, Hao Ouyang, Qiuyu Wang, Wen Wang, Qingyan Bai, Ka Leong Cheng, Yue Yu, Yixuan Li, Yihao Meng, Zichen Liu, Yanhong Zeng, Yujun Shen, Qifeng Chen. arxiv preprint, July 2026.