知识卡片:李飞飞World Labs发布多模态世界模型Atlas
英文标题(本文整理):World Labs Unveils Atlas: A Multimodal World Model
Keywords:World Labs; Atlas; Multimodal World Model; Autoregressive Diffusion Transformer; Camera Control; RGB-D; Real-to-Sim
一句话结论
据腾讯研究院AI速递(20260903)报道,李飞飞(Fei-Fei Li)的World Labs发布多模态世界模型Atlas,采用多模态自回归扩散Transformer架构。单张图片可生成最长1分钟、1440p视频,并支持像素级相机控制;稀疏视角3D重建效果据称超过专用开源模型。它还可同时建模空间与时间,为机器人生成逼真的RGB与深度数据,打通Real-to-Sim路径;目前仅向部分合作伙伴开放早期访问。
事件概述或研究问题
该速递在“李飞飞World Labs发布多模态世界模型Atlas”条目中介绍了Atlas,李飞飞视其为里程碑式成果。官方研究问题未在速递中完整展开;从报道的功能看,它体现的探索方向是:用同一个模型同时对空间结构与时间动态建模,并将生成能力延伸到3D重建和机器人仿真数据生成。
方法/产品要点
以下为报道中的产品要点:
- 架构:多模态自回归扩散Transformer。
- 输入输出:输入单张图片,可输出最长1分钟、1440p视频。
- 相机控制:支持像素级相机控制生成。
- 3D能力:稀疏视角3D重建效果超过专用开源模型。
- 空间与时间:可同时建模空间与时间。
- 机器人数据:可生成逼真RGB与深度数据,支持Real-to-Sim路径。
- 访问状态:现向部分合作伙伴开放早期访问。
主要结果或产业意义
报道称,Atlas将长视频生成、相机控制、稀疏视角3D重建与机器人RGB-D数据生成统一到一个“多模态世界模型”框架中。产业意义上,它让“生成一个可信3D空间”与“让模型理解时间变化”同步发生;对机器人训练而言,生成式RGB-D数据有望减少对真实场景数据采集的依赖,为Real-to-Sim提供更直接的数据接口。
为什么重要
Atlas展示了世界模型从“生成视频”向“可控制、可仿真、可用于机器人训练”推进的趋势。李飞飞本人将其视为里程碑式成果。
与既有脉络的关系:已有相关卡片记录World Labs收购SceniX,强调物理AI训练正从“采数据”走向“造世界”。Atlas的增量在于:它以具体产品形态发布,宣称可用单张图片完成像素级相机控制的长视频生成、稀疏视角3D重建以及机器人RGB-D数据生成,让“造世界”与机器人训练数据之间的路径更直接。
局限与不确定性
- 该速递是二次汇编,并非World Labs官方技术公告或论文;模型训练细节、评测基准和运行环境待核实。
- “稀疏视角3D重建效果超过专用开源模型”未说明具体对比模型与测试集,待核实。
- “像素级相机控制”和RGB-D数据生成的精度、分辨率、帧率、算力需求等细节未披露,待核实。
- 早期访问的伙伴范围、API形态及商业化时间未知,待核实。
- Atlas与World Labs此前收购SceniX及R2S2R成果的承接关系,该速递未直接说明,待核实。
可用于图书/PPT/简报的角度
- 作为“世界模型”成为AI基础设施的案例,说明生成模型正从“生成图片/视频”走向“生成可控空间与动态”。
- 用于解释Real-to-Sim:为机器人生成RGB与深度数据,可能替代部分真实世界采集。
- 作为多模态自回归扩散Transformer架构融合的一页案例,展示不同生成范式的交叉。
- 在“李飞飞World Labs”专题中,以Atlas代表其在“物理AI”方向的最新进展。
原始材料
- 来源标题:腾讯研究院AI速递 20260903
- 所依据条目:该速递中“二、李飞飞World Labs发布多模态世界模型Atlas”
- 原始URL:https://m.sohu.com/a/1071171604_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=2