AI消息速览

NVIDIA Vera Rubin 与 Blackwell 树立智能体 AI 每瓦性能新标准

事件日期 2026-08-25 · 产业观察 · 已接受

事件日期2026-08-25
信息日期2026-08-25
入库日期2026-08-25
通道产业观察
状态已接受
来源NVIDIA 博客

知识卡片:NVIDIA Vera Rubin 与 Blackwell 树立智能体 AI 每瓦性能新标准

一句话结论

在 SemiAnalysis AgentX 智能体编码推理基准上,NVIDIA 公布的预览结果显示:Vera Rubin NVL72 的每兆瓦 AI 工厂吞吐量可比 GB300 NVL72 最高提升约 30 倍;GB300 NVL72 又比 H200 NVL8 最高提升约 15 倍(DeepSeek V4 Pro 1.6T),在 Kimi K3 2.8T 这类大型 MoE 模型上则最高提升约 80 倍。

事件概述或研究问题

  • 智能体 AI 将推理从单轮交互扩展为多步骤工作流:模型需要推理、调用工具、协调子代理,并在轮次之间携带不断增长的上下文。
  • OpenRouter《State of AI》报告显示,在 100 万亿 token 的真实用量中,平均每个请求的 prompt token 数增长约 4 倍;单个智能体请求消耗的 token 数约为普通聊天的 15 倍。
  • 传统固定长度基准(如 8K 输入/1K 输出)已不足以代表真实智能体负载;真实负载需要捕捉长上下文 prefill、KV-cache 复用、交互式解码、工具调用间隔,以及真实并发下的分布式 MoE 执行。
  • SemiAnalysis 推出 AgentX 基准,作为 InferenceX 开源基准套件的一部分。它回放预录的 Claude Code 会话,保留上下文、输入/输出长度、推理时间和工具调用延迟,让不同系统接收相同流量,从而比较服务栈差异,而非测试集定制优化。

方法/产品要点

  • AgentX 核心指标是 tokens per megawatt,即每兆瓦可用 token 吞吐量;同时报告 E2E Normalized Interactivity、Standard Interactivity、E2E Latency 和 TTFT,以判断高效率是否仍伴随可用的用户体验。
  • AgentX 会改变并发度,刻画吞吐量与交互性之间的权衡;还会衡量系统在长会话中复用重复上下文的能力。
  • 这些效率提升来自系统级优化,而非单一芯片规格:
    • MoE 服务运行时:SGLang、TensorRT-LLM、vLLM 等通过 Wide Expert Parallelism、DeepEP 在 NVL72 域内分配专家执行。
    • 内核与通信:DeepGEMM 内核、MXFP4/MXFP8 混合精度、融合 MoE 执行路径,并将专家并行通信与 Tensor Core 计算重叠。
    • NVIDIA Dynamo:分离 prefill 与 decode 工作池,支持 session-aware serving;通过 KV-cache-aware router 减少不必要的 prefill 计算。
    • NVIDIA NVLink scale-up fabric:连接 72 块 GPU,形成机架级协调推理系统,支撑大规模 MoE 的专家并行与 KV-cache 移动。

主要结果或产业意义

  • 在 AgentX DeepSeek V4-Pro 工作负载、每用户 160 tokens/s 的交互目标下,Vera Rubin NVL72 的每兆瓦 AI 工厂吞吐量比 GB300 NVL72 最高提升约 30 倍。该结果为 NVIDIA 测量,待 SemiAnalysis 审核。
  • GB300 NVL72 在 AgentX 上延续了代际效率优势:
    • 在 DeepSeek V4 Pro 1.6T 上,每兆瓦吞吐量比 H200 NVL8 最高提升约 15 倍。
    • 在 Kimi K3 2.8T 上,每兆瓦吞吐量比 H200 NVL8 最高提升约 80 倍,并将交互性边界扩展到约 215 tokens/s/用户。
  • GB300 NVL72 的每百万 token 成本比 H200 NVL8 最高降低约 10 倍。
  • 产业意义:在固定电力与基础设施预算下,新一代平台可以支撑更多交互式智能体容量,或以更低成本提供同等容量。AI 工厂的竞争指标正在从“峰值算力”转向“每瓦有用吞吐量”。

为什么重要

  • 智能体 AI 正在改变数据中心的推理负载结构:请求更长、状态化更强、KV-cache 复用与工具调用间隔显著增加。只看芯片峰值算力无法反映真实用户体验。
  • “每瓦性能”不仅影响性能,也直接决定 AI 工厂的单位经济学:电力预算内能产出多少有用的智能体 token。
  • 本卡是对已有 NVIDIA Vera CPU、Rubin GPU 架构卡片的延续:先前卡片侧重架构设计,本卡补充了 AgentX 基准、每兆瓦吞吐量预览数据,以及服务栈层面的系统级优化。

局限与不确定性

  • Vera Rubin NVL72 的 30x 数据为 NVIDIA 发布、待 SemiAnalysis 独立审核的预览结果,最终数值可能有变化。
  • AgentX 目前聚焦编码类智能体会话,未必覆盖所有智能体应用场景,例如多模态或非编码任务。
  • 原文中的“up to”来自特定模型、特定交互目标和特定配置;不同模型与并发条件下,提升倍数可能不同。
  • GB300 NVL72 与 H200 NVL8 的对比涉及 NVL72 与 NVL8 两种不同基础设施形态,并非单纯 GPU 芯片对比。
  • 更完整的复现条件可查看 SemiAnalysis InferenceX 仪表盘或原文。

与既有脉络的关系

  • 已有卡片提到 Rubin GPU 架构相对 Blackwell 的每单位能源吞吐提升;本卡的 AgentX 系统级结果进一步显示,Vera Rubin NVL72 在真实智能体负载下每兆瓦吞吐量可比 GB300 NVL72 最高提升约 30 倍。
  • 两者口径不同:前者是架构级估计,后者是工作负载/系统级基准结果。本卡以原文发布数据为准,并明确标注“待 SemiAnalysis 审核”。

可用于图书/PPT/简报的角度

  • 用“tokens per megawatt”重新定义 AI 工厂竞争力。
  • 用 AgentX 说明为什么传统固定长度基准会低估智能体推理的复杂度。
  • 用“100 万亿 token 使用量中平均 prompt 增长 4 倍、智能体请求消耗 15 倍 token”作为智能体负载爆发的量化证据。
  • 用“Vera Rubin 30x、GB300 15x/80x、成本 10x”作为每瓦性能代际跃迁的核心数字。
  • 用 Dynamo、NVLink、MoE 运行时等说明“系统级协同设计”比单芯片更关键。

原始材料

  • 英文标题:NVIDIA Vera Rubin and Blackwell Set a New Standard for Agentic AI Performance per Watt
  • 英文关键词:Agentic AI, Performance per Watt, Vera Rubin, Blackwell, AgentX, InferenceX, MoE Serving, NVIDIA Dynamo, NVLink
  • 来源:NVIDIA Technical Blog
  • 作者:Jamie Li, Eduardo Alvarez
  • 日期:Aug 24, 2026
  • URL:https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt