知识卡片:M⁴World:面向交互式物体操控与分钟级长时流的多视角多模态驾驶世界模型
英文标题:M$^\text{4}$World: A Multi-view Multimodal Driving World Model for Interactive Object Manipulation and Minute-long Streaming
英文关键词:driving world model, multi-view, multimodal, object manipulation, minute-long streaming, controllable generation, LiDAR simulation
一句话结论
M⁴World 是一个能够同时生成未来环视视频流和同步 LiDAR 点云的多视角多模态驾驶世界模型,支持用户在个体物体级别进行交互式操控,并可稳定输出长达分钟级的流式预测。
事件概述或研究问题
驾驶世界生成(driving-world generation)是实现可扩展自动驾驶仿真的核心技术,但已有方法在物体级别的精细可控性以及长时间跨度的稳定性上存在明显不足。本文提出 M⁴World 以同时解决这两个瓶颈。
方法/产品要点
- 多模态生成:模型同时合成环视多视角视频流和与之时间同步的 LiDAR 扫描数据。
- 交互式物体操控:通过灵活的条件接口,用户可显式控制单个物体的空间布局(位置、姿态等)和视觉外观(纹理、颜色等),实现细粒度物体级操控。
- 分钟级稳定流式生成:采用多阶段训练框架,在线因果推理仅需 4 步去噪即可生成长达数分钟的连贯世界动态,保持长程 rollout 中的动力学一致性。
- 长尾可控性增强:引入高效少剪辑后训练(few-clip post-training)和一套视觉参考条件生成模型,在保留通用生成能力的同时支持罕见场景的定制化生成。
- 自动化评估管道:提出基于 VLM(视觉语言模型)的自动评判流程,评估场景级条件遵循程度、逐视角物体可控性和跨视角物体一致性,弥补了仅关注真实感的评估不足。
主要结果或产业意义
综合实验表明,M⁴World 在生成质量、精确可控性和分钟级稳定流式生成方面均达到一致的高水平。该模型可直接用于下游长尾数据增强(long-tail augmentation)和场景编辑,为可控、可扩展的自动驾驶仿真提供了有效的技术路径。
为什么重要
本工作首次同时实现了 物体级别的交互式操控 与 分钟级长时间稳定的环视视频+LiDAR 联合生成,并提出了配套的自动化可控性评估体系。它弥补了此前驾驶世界模型在精细控制和长程稳定性上的短板,推动仿真数据生成向更真实、更可控、更可用的方向迈进。
局限与不确定性
- 根据所提供材料,未明确提及模型在复杂极端天气、多物体密集交互等场景下的表现,需进一步验证。
- 少剪辑后训练和视觉参考条件生成的具体效果边界未详细说明,待核实。
- 分钟级流式生成的误差累积上限及与真实数据分布的长期偏移程度尚待更多实验。
可用于图书/PPT/简报的角度
- 可强调“可控驾驶世界模型”作为一种新范式,如何将仿真数据生成从“被动生成”升级为“主动编辑”。
- 适用于讲解自动驾驶仿真中的数据稀缺问题(长尾场景)以及生成式世界模型的最新进展。
- 可对比传统基于规则/图形学的仿真与基于学习的生成式仿真之间的可控性与真实感权衡。
原始材料
- arXiv 页面:https://arxiv.org/abs/2607.14005v1
- 论文标题:M$^\text{4}$World: A Multi-view Multimodal Driving World Model for Interactive Object Manipulation and Minute-long Streaming
- 作者:Ke Cheng, Hanqiao Ye, Lei Shi, Yahui Liu, Yunhan Shen, Jingtao Dong, Zhenke Wang, Wenxuan Ao, Weixiang Xu, Kaining Huang, Shuhan Shen
- 提交日期:2026-07-15