AI消息速览

NVIDIA Alpamayo 2 Super——面向自动驾驶的开放式推理视觉-语言-动作模型

事件日期 2026-08-05 · 产业观察 · 已接受

事件日期2026-08-05
信息日期2026-08-05
入库日期2026-08-05
通道产业观察
状态已接受
来源NVIDIA 博客

知识卡片:NVIDIA Alpamayo 2 Super——面向自动驾驶的开放式推理视觉-语言-动作模型

一句话结论

NVIDIA Alpamayo 2 Super 是一个 340 亿参数的开放推理视觉-语言-动作模型,将 32B Cosmos 3 Super Reasoner 与 2B 扩散式 Action Expert 组合,通过强化学习后训练,面向自动驾驶统一完成轨迹生成、推理链、meta-action 预测、视觉问答与自动标注等任务。

事件概述/研究问题

自动驾驶开发常依赖多套独立模型分别处理轨迹生成、高层意图预测、场景理解和数据标注。这种“分立”方式难以比较相关输出、排查模型行为,也无法在开发流程中复用同一套表征。Alpamayo 2 Super 的目标是用一个统一基础模型覆盖多个开发阶段。

方法/产品要点

  • 架构:32B NVIDIA Cosmos 3 Super Reasoner + 2B 基于扩散的 Action Expert,后训练采用强化学习。
  • 输入:最多 7 路摄像头实现 360 度感知,融合语言上下文和历史运动信息。
  • 输出:未来轨迹、Chain-of-Causation(CoC)推理轨迹、高层 meta-actions(如 yield、change lanes、stop)、带 2D grounding 的场景问答、结构化 reasoning auto-labels。
  • 应用定位:同一模型可作为离线策略教师、评估 critic、数据引擎,或作为新任务定制的起点。
  • 开放与许可:权重在 Hugging Face,推理 notebook 在 GitHub;采用 Linux Foundation 宽松许可 OpenMDW-1.1,允许微调、衍生模型和商业再分发;蒸馏模型可不经 NVIDIA 额外许可用于商业部署。

主要结果/产业意义

  • 开环轨迹预测:在 Physical AI AV Dataset 的 1,434 个挑战样本上,6.4 秒 minADE_6 为 0.911m,优于 Alpamayo 1.5 Nano 的 0.916m(越低越好)。
  • AV reasoning:Physical AI AV Reasoning Benchmark 得分 0.433,高于 Alpamayo 1.5 Nano 的 0.414;参考分数中 GPT-5.5 为 0.502。
  • LingoQA:得分 79.2,在 37 个被评估模型中排名第一;高于 Qwen3-VL 32B(72.2)、Qwen2.5-VL 72B(62.2)、Gemini 2.5 Pro(64.1)、GPT-4o(56.0)。
  • 闭环 AlpaSim:在 Physical AI AV NuRec 的 913 个重建场景上,AlpaSim Score 为 1.50 ± 0.13,高于 Alpamayo 1.5 Nano 的 1.37 ± 0.10(按表中说明越高越好)。
  • 页面 AI 摘要还报告了 meta-action IoU(lateral 74.59、longitudinal 61.91、lane-wise 73.55)、VQA answer similarity 0.652、2D grounding IoU 0.71,并称其为 state-of-the-art;这些数字在正文摘录中未完整展开,待核实。
  • 产业意义:用统一基础模型替代多套独立模型,降低跨阶段开发与复用的成本;开放权重 + 宽松许可有利于行业采用,并可衔接 NVIDIA Halos 安全验证工作流。

为什么重要

Alpamayo 2 Super 不只是“更大的轨迹预测模型”,而是把轨迹、推理、高层意图、问答和标注放在同一个基础模型中。轨迹回答“车接下来怎么开”,CoC 推理轨迹回答“为什么这样开”,从而便于调试、难例筛选和部署策略与大型教师模型的对比。它还同时支持开环评测和闭环 AlpaSim 仿真,能发现轨迹影响后续场景后才暴露的碰撞、驶出道路、近距离交会等问题。

与既有脉络的关系

本条与已收录的 Physical Intelligence π0.6、NVIDIA Isaac GR00T 卡片不同:π0.6 聚焦机器人操作,GR00T 聚焦人形机器人端到端策略开发,而 Alpamayo 2 Super 聚焦自动驾驶 VLA 基础模型,增量能力主要在可解释推理链、meta-action 预测和自动标注。与“金融 AI 研究中的合成数据生成——NVIDIA NeMo”卡片不直接相关。

局限与不确定性

  • 来源为 NVIDIA 技术博客,基准结果和“第一/最优”表述为 NVIDIA 自报,尚缺第三方独立验证。
  • 训练数据规模、计算资源、数据许可、评测集构成等未在材料中给出。
  • 页面 AI 摘要中的 meta-action IoU、VQA 相似度、2D grounding IoU 等数值,在正文摘录中没有完整展开,使用前建议核对官方模型卡或论文。
  • OpenMDW-1.1 的具体条款和“蒸馏模型可商业部署”的边界应以许可证原文为准。
  • AlpaSim Score 的具体计算方式与安全指标权重未在本文展开,待核实。

可用于图书/PPT/简报的角度

  • 标题角度:自动驾驶中的“一个模型干到底”:轨迹 + 推理 + 标注。
  • 图表角度:用来源中的表 1 对比开环评测与闭环 AlpaSim 分数。
  • 方法角度:从“分立 AV 模型”到“统一基础模型 + 强化学习后训练”的设计选择。
  • 产业角度:开放权重 + 宽松许可如何影响自动驾驶的数据闭环、策略评估与安全验证。

原始材料

  • 英文标题:Generate Trajectories, Reasoning Traces, and Auto-Labels with NVIDIA Alpamayo 2 Super
  • 英文关键词:Alpamayo 2 Super; trajectory generation; reasoning traces; auto-labeling; autonomous vehicles; vision-language-action model; Cosmos 3 Super Reasoner; AlpaSim
  • 来源:NVIDIA Technical Blog,Aug 04, 2026
  • URL: https://developer.nvidia.com/blog/generate-trajectories-reasoning-traces-and-auto-labels-with-nvidia-alpamayo-2-super