AI消息速览

NVIDIA Cosmos 3 Edge 后训练用于端侧机器人控制

事件日期 2026-08-20 · 产业观察 · 已接受

事件日期2026-08-20
信息日期2026-08-20
入库日期2026-08-20
通道产业观察
状态已接受
来源NVIDIA 博客

知识卡片:NVIDIA Cosmos 3 Edge 后训练用于端侧机器人控制

一句话结论

NVIDIA Cosmos 3 Edge 是一个约 4B 参数的世界基础模型,经后训练可变成机器人操作策略,并原生运行在 Jetson Thor 上,实现无数据中心 GPU 参与的实时端侧控制。

事件概述或研究问题

世界模型能够学习物体运动和物理交互规律,但模型体积过大通常难以在机器人机载硬件上部署。NVIDIA 推出的 Cosmos 3 Edge 属于 Cosmos 3 系列,模型大小适合在 Jetson Thor 上运行;本文展示了如何将其后训练为机器人操作策略,并在闭环模拟中评估。

方法/产品要点

  • 模型规格:Cosmos 3 Edge 是一个 4B omni-model,内置 2B NVIDIA Nemotron-based reasoner;与 Cosmos 3 Nano 和 Cosmos 3 Super 使用相同的物理世界数据预训练。
  • 后训练数据:使用 nvidia/Cosmos3-DROID 数据集,包含 76k 条成功遥操作轨迹,约 350 小时,覆盖 86 个任务、564 个场景,使用 Franka Panda 臂和 Robotiq 夹爪采集。
  • 后训练流程:下载数据集 → 将基础 checkpoint 转为 DCP 格式 → 应用数据筛选 → 启动训练。推荐使用 DGX Station(GB200 或 GB300)等高性能硬件,本次验证使用 64 节点 4×GB200,60K 迭代,约 68 小时(约 17.4K GB200-hours)。
  • 部署方式:通过 OpenPI 协议的 WebSocket 策略服务器提供服务,服务器原生运行在 Jetson Thor 上;模型权重约 9GB(BF16),可放入机载显存。
  • 控制模式:策略输出 32 个未来动作(15 Hz),执行前 16 个动作后重新规划,实现流式连续控制。
  • 支持多种实施例:包括双臂 Franka、UR、WidowX 250、LeRobot SO101 等(完整列表见模型卡)。

主要结果或产业意义

  • 在 NVIDIA Jetson AGX Thor T5000 上,后训练的 DROID 动作策略生成一个动作块约需 1.53 秒(640×540 分辨率、15 Hz),一个动作块覆盖约 2.13 秒的机器人运动;下一个动作块在当前动作块完成前已准备好,因此机械臂可以连续运动。
  • 在闭环 RoboLab 任务中,后训练策略成功率达到 22.9%。
  • 该结果表明,一个 4B 世界基础模型可以成为实用、实时、端侧运行的机器人策略骨干。

为什么重要

本条展示了“世界模型预训练 + 端侧后训练”的机器人控制路线。与 Physical Intelligence π*0.6 这类从经验中学习的方法不同,Cosmos 3 Edge 以大规模物理世界预训练为起点,后训练所需任务数据相对更少。同时,它直接运行在 Jetson Thor 上,不需要数据中心 GPU,为机器人的真实部署提供了一条低延迟、高自主性的路径。相对已有 NVIDIA 机器人生态卡片,本条从“模型后训练 + 机载部署”角度补充了具体技术细节。

局限与不确定性

  • 闭环 RoboLab 的成功率为 22.9%,属于模拟环境结果,真实世界性能待核实。
  • 后训练计算资源门槛高,文中明确这不是单 GPU 微调,而是需要多节点 GB200/GB300 集群。
  • 支持的具体实施例范围以及不同硬件适配效果需查阅模型卡确认,部分细节在材料中未展开。
  • 文中的数据集可公开获取,但完整复现需访问 Hugging Face checkpoint 和数据集,许可条款待核实。

可用于图书/PPT/简报的角度

  • 世界模型从云端数据中心走向机器人边缘硬件的典型案例。
  • 端侧机器人控制的全栈技术:Cosmos 3 Edge + Jetson Thor + OpenPI 协议。
  • 后训练大模型成为机器人操作策略的标准流程:数据准备、分布式训练、模型量化/部署、闭环评估。
  • 对比不同机器人策略路线:世界模型预训练 vs. 从经验中强化学习。

与既有脉络的关系

本条未提及宇树 H2 Plus,但可视为 NVIDIA 机器人生态中“模型 + 硬件”布局在策略模型层面的延伸。与 Physical Intelligence π*0.6 卡片相比,本条提供了一种利用世界模型预训练来减少任务演示依赖的替代方案,并强调端侧实时运行能力。

原始材料

  • 英文标题:Post-Train NVIDIA Cosmos 3 Edge for On-Device Robot Control
  • 英文关键词:Post-Train, NVIDIA Cosmos 3 Edge, On-Device Robot Control
  • 来源:NVIDIA Technical Blog
  • 作者:Saeed Babamohamadi
  • 日期:Aug 19, 2026
  • URL: https://developer.nvidia.com/blog/post-train-nvidia-cosmos-3-edge-for-on-device-robot-control