AI消息速览

李飞飞World Labs发布多模态世界模型Atlas

事件日期 2026-09-03 · 产业观察 · 已接受

事件日期2026-09-03
信息日期2026-09-03
入库日期2026-09-03
通道产业观察
状态已接受
来源腾讯研究院(搜狐同步)

知识卡片:李飞飞World Labs发布多模态世界模型Atlas

英文标题(本文整理):World Labs Unveils Atlas: A Multimodal World Model
Keywords:World Labs; Atlas; Multimodal World Model; Autoregressive Diffusion Transformer; Camera Control; RGB-D; Real-to-Sim

一句话结论

据腾讯研究院AI速递(20260903)报道,李飞飞(Fei-Fei Li)的World Labs发布多模态世界模型Atlas,采用多模态自回归扩散Transformer架构。单张图片可生成最长1分钟、1440p视频,并支持像素级相机控制;稀疏视角3D重建效果据称超过专用开源模型。它还可同时建模空间与时间,为机器人生成逼真的RGB与深度数据,打通Real-to-Sim路径;目前仅向部分合作伙伴开放早期访问。

事件概述或研究问题

该速递在“李飞飞World Labs发布多模态世界模型Atlas”条目中介绍了Atlas,李飞飞视其为里程碑式成果。官方研究问题未在速递中完整展开;从报道的功能看,它体现的探索方向是:用同一个模型同时对空间结构与时间动态建模,并将生成能力延伸到3D重建和机器人仿真数据生成。

方法/产品要点

以下为报道中的产品要点:

  • 架构:多模态自回归扩散Transformer。
  • 输入输出:输入单张图片,可输出最长1分钟、1440p视频。
  • 相机控制:支持像素级相机控制生成。
  • 3D能力:稀疏视角3D重建效果超过专用开源模型。
  • 空间与时间:可同时建模空间与时间。
  • 机器人数据:可生成逼真RGB与深度数据,支持Real-to-Sim路径。
  • 访问状态:现向部分合作伙伴开放早期访问。

主要结果或产业意义

报道称,Atlas将长视频生成、相机控制、稀疏视角3D重建与机器人RGB-D数据生成统一到一个“多模态世界模型”框架中。产业意义上,它让“生成一个可信3D空间”与“让模型理解时间变化”同步发生;对机器人训练而言,生成式RGB-D数据有望减少对真实场景数据采集的依赖,为Real-to-Sim提供更直接的数据接口。

为什么重要

Atlas展示了世界模型从“生成视频”向“可控制、可仿真、可用于机器人训练”推进的趋势。李飞飞本人将其视为里程碑式成果。

与既有脉络的关系:已有相关卡片记录World Labs收购SceniX,强调物理AI训练正从“采数据”走向“造世界”。Atlas的增量在于:它以具体产品形态发布,宣称可用单张图片完成像素级相机控制的长视频生成、稀疏视角3D重建以及机器人RGB-D数据生成,让“造世界”与机器人训练数据之间的路径更直接。

局限与不确定性

  • 该速递是二次汇编,并非World Labs官方技术公告或论文;模型训练细节、评测基准和运行环境待核实。
  • “稀疏视角3D重建效果超过专用开源模型”未说明具体对比模型与测试集,待核实。
  • “像素级相机控制”和RGB-D数据生成的精度、分辨率、帧率、算力需求等细节未披露,待核实。
  • 早期访问的伙伴范围、API形态及商业化时间未知,待核实。
  • Atlas与World Labs此前收购SceniX及R2S2R成果的承接关系,该速递未直接说明,待核实。

可用于图书/PPT/简报的角度

  • 作为“世界模型”成为AI基础设施的案例,说明生成模型正从“生成图片/视频”走向“生成可控空间与动态”。
  • 用于解释Real-to-Sim:为机器人生成RGB与深度数据,可能替代部分真实世界采集。
  • 作为多模态自回归扩散Transformer架构融合的一页案例,展示不同生成范式的交叉。
  • 在“李飞飞World Labs”专题中,以Atlas代表其在“物理AI”方向的最新进展。

原始材料

  • 来源标题:腾讯研究院AI速递 20260903
  • 所依据条目:该速递中“二、李飞飞World Labs发布多模态世界模型Atlas”
  • 原始URL:https://m.sohu.com/a/1071171604_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=2