AI消息速览

超越VLA——世界动作模型(WAM)如何重塑机器人操作

事件日期 2026-08-04 · 产业观察 · 已接受

事件日期2026-08-04
信息日期2026-08-04
入库日期2026-08-05
通道产业观察
状态已接受
来源NVIDIA 博客

知识卡片:超越VLA——世界动作模型(WAM)如何重塑机器人操作

一句话结论

NVIDIA 技术博客提出,以视频世界模型为骨干的“世界动作模型(WAM)”正在挑战传统视觉-语言-动作模型(VLA)范式;开放的 NVIDIA Cosmos 3 世界基础模型可作为 WAM 后训练的强起点,在物理泛化、少样本适应新机器人和部署灵活性上带来可量化的收益。

事件概述或研究问题

机器人策略的核心难题是“超越训练示范的泛化”:物体形状、位置或光照变化时,策略往往失效。传统 VLA 在预训练的视觉-语言模型(VLM)上增加动作模块,但 VLM 擅长“描述”世界而非“预测世界如何演化”。NVIDIA 研究员 Jim Fan 在 “Robotics’ End Game” 演讲中探讨了这一转变,并被总结为 “VLAs are dead, long live World Action Models.” 本文介绍如何通过后训练将 WAM 变成专用机器人策略,并论证 Cosmos 3 为何是合适的 WAM 基础。

方法/产品要点

  • WAM 的核心理念:用视频世界模型替代语言模型作为骨干,联合预测视频和动作,从而让策略具备“物理先验”,而不是只做语义映射。
  • WAM 相对 VLA 的三个优势
    1. 能从更多样、更便宜的数据中学习(任意交互数据都包含物理规律)。
    2. 在开放世界中泛化更好(物理规律比语义更通用)。
    3. 适应新机器人只需少量示范。
  • NVIDIA Cosmos 3:一个“omni-model”世界基础模型,采用 Mixture-of-Transformers (MoT) 架构;文本通过自回归 token 解码,图像、视频、音频和动作通过扩散 transformer 迭代去噪生成。提供三个尺寸:4B Cosmos Edge、16B Cosmos Nano、64B Cosmos 3 Super
  • 训练数据规模(原文数据):约 7.67 亿张图像、3.48 亿段真实世界动态视频、800 万个动作样本(涵盖机器人操作、自动驾驶、相机运动、第一人称运动)。
  • 后训练策略示例Cosmos3-Nano-Policy-DROID(16B)和 Cosmos3-Edge-Policy-DROID(4B),针对 DROID 平台(Franka Panda 臂 + Robotiq 夹爪)。模型可根据语言指令和多相机观察生成动作轨迹,同时还能输出预测视频。
  • 部署方式
    • 工作站侧:16B 模型在 NVIDIA RTX PRO 6000 上运行,机器人通过网络传输观察并接收动作块。
    • 边缘端:4B 模型在 NVIDIA Jetson Thor 上以 640×360 分辨率、每次推理生成 32 个动作,实现 15 Hz 实时控制;支持 RTX PRO、DGX、GeForce RTX 和 Jetson(含 T2000/T3000)。

主要结果或产业意义

  • 可量化的物理先验收益:Cosmos 3 技术报告对比了相同训练配方、数据和算力下的两个 DROID 策略:从基座检查点开始训练的 RoboLab 成功率为 28.1%;从包含多域动作数据的 omni 检查点开始训练的为 36.8%,提升约 8.7 个百分点,说明收益来自架构而非单纯规模。
  • 开放生态:Cosmos 3 的基础模型、数据集、后训练配方、训练权重、评估工具和服务栈均以允许商业使用的许可证开放。
  • 产业路径:WAM 让“少数据、快适配、多机器人复用”成为可能;每个新机器人平台仍需单独后训练,但都从同一预训练基础出发,而不是从零训练世界模型。

为什么重要

  • 这是对“VLA vs WAM”范式争论的一次具体产品化回应:不只是论文概念,NVIDIA 给出了可下载的模型权重、可复现的后训练配方和从数据中心到边缘的部署方案。
  • 与既有“世界-动作模型崛起”卡片相比,本条提供了具体的 NVIDIA Cosmos 3 实现细节、数据规模、DROID 策略性能和端侧部署指标,是 WAM 从研究走向工程实践的重要增量信息。
  • 与 Physical Intelligence π*0.6 的“模型/数据/强化学习”路线不同,Cosmos 3 走的是“视频世界模型 + 多模态扩散生成 + 开放生态”路线,展示了另一条机器人基础模型路径。

局限与不确定性

  • WAM 携带完整的生成式世界模型,而非仅一个动作头,体积大于紧凑 VLA,部署成本更高。
  • 每个新机器人本体(如 Franka、双臂、UR、WidowX)仍需要各自的后训练运行,并非零成本迁移。
  • 文章是 NVIDIA 技术博客,存在推广自家产品的视角;WAM 是否在广泛任务上全面超过 VLA,仍需第三方独立验证和更多基准测试(待核实)。
  • 原文未提供 Cosmos 3 与具体 VLA 模型在相同算力/成本下的直接对比数据,因此“更少数据、更好泛化”的说法在多大程度普适,仍需进一步确认(待核实)。

可用于图书/PPT/简报的角度

  • 从“语言理解”到“物理预测”:机器人基础模型的下一站。
  • 为什么“会描述世界”不等于“会操作世界”——VLA 与 WAM 的本质差异。
  • NVIDIA Cosmos 3 拆解:一个模型如何同时生成文本、视频、音频和机器人动作。
  • 世界动作模型的商业化落地:从 RTX PRO 工作站到 Jetson 边缘的 15 Hz 实时控制。
  • 开放模型 + 后训练配方:机器人团队如何快速试出“WAM 是否比 VLA 更适合我的任务”。

与既有脉络的关系

此前卡片已指出 WAM 作为与 VLA 并行的第二大机器人基础模型范式,且争议点在于成本、速度和是否真正取代 VLA。本条以 NVIDIA Cosmos 3 为例,提供了“开放基础模型 + 世界模型后训练 + 多级部署”的增量证据:包括 DROID 策略成功率从 28.1% 提升到 36.8%、4B 边缘模型在 Jetson Thor 上 15 Hz 实时控制等具体数字,使 WAM 的讨论从概念争议进入可验证、可部署的工程层面。

原始材料

  • 英文标题:Beyond VLAs: How World Action Models Reshape Robot Manipulation
  • 原文 URL:https://developer.nvidia.com/blog/beyond-vlas-how-world-action-models-reshape-robot-manipulation
  • 英文关键词:World Action Models (WAM), Vision-Language-Action Models (VLA), NVIDIA Cosmos 3, Robot Manipulation, Physical AI, Mixture-of-Transformers, DROID, Jetson Thor
  • 作者:Saeed Babamohamadi(NVIDIA 技术营销工程师)
  • 发布日期:2026 年 8 月 4 日