知识卡片:超越VLA——世界动作模型(WAM)如何重塑机器人操作
一句话结论
NVIDIA 技术博客提出,以视频世界模型为骨干的“世界动作模型(WAM)”正在挑战传统视觉-语言-动作模型(VLA)范式;开放的 NVIDIA Cosmos 3 世界基础模型可作为 WAM 后训练的强起点,在物理泛化、少样本适应新机器人和部署灵活性上带来可量化的收益。
事件概述或研究问题
机器人策略的核心难题是“超越训练示范的泛化”:物体形状、位置或光照变化时,策略往往失效。传统 VLA 在预训练的视觉-语言模型(VLM)上增加动作模块,但 VLM 擅长“描述”世界而非“预测世界如何演化”。NVIDIA 研究员 Jim Fan 在 “Robotics’ End Game” 演讲中探讨了这一转变,并被总结为 “VLAs are dead, long live World Action Models.” 本文介绍如何通过后训练将 WAM 变成专用机器人策略,并论证 Cosmos 3 为何是合适的 WAM 基础。
方法/产品要点
- WAM 的核心理念:用视频世界模型替代语言模型作为骨干,联合预测视频和动作,从而让策略具备“物理先验”,而不是只做语义映射。
- WAM 相对 VLA 的三个优势:
- 能从更多样、更便宜的数据中学习(任意交互数据都包含物理规律)。
- 在开放世界中泛化更好(物理规律比语义更通用)。
- 适应新机器人只需少量示范。
- NVIDIA Cosmos 3:一个“omni-model”世界基础模型,采用 Mixture-of-Transformers (MoT) 架构;文本通过自回归 token 解码,图像、视频、音频和动作通过扩散 transformer 迭代去噪生成。提供三个尺寸:4B Cosmos Edge、16B Cosmos Nano、64B Cosmos 3 Super。
- 训练数据规模(原文数据):约 7.67 亿张图像、3.48 亿段真实世界动态视频、800 万个动作样本(涵盖机器人操作、自动驾驶、相机运动、第一人称运动)。
- 后训练策略示例:
Cosmos3-Nano-Policy-DROID(16B)和Cosmos3-Edge-Policy-DROID(4B),针对 DROID 平台(Franka Panda 臂 + Robotiq 夹爪)。模型可根据语言指令和多相机观察生成动作轨迹,同时还能输出预测视频。 - 部署方式:
- 工作站侧:16B 模型在 NVIDIA RTX PRO 6000 上运行,机器人通过网络传输观察并接收动作块。
- 边缘端:4B 模型在 NVIDIA Jetson Thor 上以 640×360 分辨率、每次推理生成 32 个动作,实现 15 Hz 实时控制;支持 RTX PRO、DGX、GeForce RTX 和 Jetson(含 T2000/T3000)。
主要结果或产业意义
- 可量化的物理先验收益:Cosmos 3 技术报告对比了相同训练配方、数据和算力下的两个 DROID 策略:从基座检查点开始训练的 RoboLab 成功率为 28.1%;从包含多域动作数据的 omni 检查点开始训练的为 36.8%,提升约 8.7 个百分点,说明收益来自架构而非单纯规模。
- 开放生态:Cosmos 3 的基础模型、数据集、后训练配方、训练权重、评估工具和服务栈均以允许商业使用的许可证开放。
- 产业路径:WAM 让“少数据、快适配、多机器人复用”成为可能;每个新机器人平台仍需单独后训练,但都从同一预训练基础出发,而不是从零训练世界模型。
为什么重要
- 这是对“VLA vs WAM”范式争论的一次具体产品化回应:不只是论文概念,NVIDIA 给出了可下载的模型权重、可复现的后训练配方和从数据中心到边缘的部署方案。
- 与既有“世界-动作模型崛起”卡片相比,本条提供了具体的 NVIDIA Cosmos 3 实现细节、数据规模、DROID 策略性能和端侧部署指标,是 WAM 从研究走向工程实践的重要增量信息。
- 与 Physical Intelligence π*0.6 的“模型/数据/强化学习”路线不同,Cosmos 3 走的是“视频世界模型 + 多模态扩散生成 + 开放生态”路线,展示了另一条机器人基础模型路径。
局限与不确定性
- WAM 携带完整的生成式世界模型,而非仅一个动作头,体积大于紧凑 VLA,部署成本更高。
- 每个新机器人本体(如 Franka、双臂、UR、WidowX)仍需要各自的后训练运行,并非零成本迁移。
- 文章是 NVIDIA 技术博客,存在推广自家产品的视角;WAM 是否在广泛任务上全面超过 VLA,仍需第三方独立验证和更多基准测试(待核实)。
- 原文未提供 Cosmos 3 与具体 VLA 模型在相同算力/成本下的直接对比数据,因此“更少数据、更好泛化”的说法在多大程度普适,仍需进一步确认(待核实)。
可用于图书/PPT/简报的角度
- 从“语言理解”到“物理预测”:机器人基础模型的下一站。
- 为什么“会描述世界”不等于“会操作世界”——VLA 与 WAM 的本质差异。
- NVIDIA Cosmos 3 拆解:一个模型如何同时生成文本、视频、音频和机器人动作。
- 世界动作模型的商业化落地:从 RTX PRO 工作站到 Jetson 边缘的 15 Hz 实时控制。
- 开放模型 + 后训练配方:机器人团队如何快速试出“WAM 是否比 VLA 更适合我的任务”。
与既有脉络的关系
此前卡片已指出 WAM 作为与 VLA 并行的第二大机器人基础模型范式,且争议点在于成本、速度和是否真正取代 VLA。本条以 NVIDIA Cosmos 3 为例,提供了“开放基础模型 + 世界模型后训练 + 多级部署”的增量证据:包括 DROID 策略成功率从 28.1% 提升到 36.8%、4B 边缘模型在 Jetson Thor 上 15 Hz 实时控制等具体数字,使 WAM 的讨论从概念争议进入可验证、可部署的工程层面。
原始材料
- 英文标题:Beyond VLAs: How World Action Models Reshape Robot Manipulation
- 原文 URL:https://developer.nvidia.com/blog/beyond-vlas-how-world-action-models-reshape-robot-manipulation
- 英文关键词:World Action Models (WAM), Vision-Language-Action Models (VLA), NVIDIA Cosmos 3, Robot Manipulation, Physical AI, Mixture-of-Transformers, DROID, Jetson Thor
- 作者:Saeed Babamohamadi(NVIDIA 技术营销工程师)
- 发布日期:2026 年 8 月 4 日