知识卡片:英伟达首测Vera Rubin,DeepSeek吞吐提升30倍
英文标题:NVIDIA First Tests Vera Rubin, DeepSeek Throughput Up 30x 英文关键词:NVIDIA Vera Rubin; DeepSeek V4 Pro; AgentX benchmark; Agentic AI; NVLink; NVFP4; Groq 3 LPX; Vera CPU 原始来源:https://m.sohu.com/a/1067538635_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=1
一句话结论
英伟达首次公布下一代机柜级系统 Vera Rubin NVL72 的片上实测结果:使用 DeepSeek-V4-Pro 运行智能体编码任务,每兆瓦吞吐较 GB300 最高提升约 30 倍,每百万 Token 成本最高下降约 35 倍;同期还发布了首款 Agent 专用 Vera CPU,并被 SpaceXAI 规模化部署。
事件概述或研究问题
在 Agent 时代,旧有基准已不足以衡量推理系统。英伟达改用反映上下文增长与工具调用的 AgentX 测试,首次对 Vera Rubin NVL72 进行“片上实测”,对比现有主力 GB300。
方法/产品要点
- 测试负载:以 DeepSeek-V4-Pro 跑智能体编码任务。
- 指标:每兆瓦吞吐(AI 工厂效率)、每百万 Token 成本。
- 性能来源:分离式服务、KV 感知路由、NVFP4 量化、第六代 NVLink 协同设计。
- 同期动态:Groq 3 LPX 全面量产,长上下文输出达每秒 3400 Token;英伟达发布首款 Agent 专用 Vera CPU,已被 SpaceXAI 规模化部署并计划送上太空(原文如此)。
主要结果或产业意义
- 每兆瓦吞吐较 GB300 最高提升约 30 倍;每百万 Token 成本最高下降约 35 倍。
- Agent 时代旧基准失效,AgentX 测试成为衡量智能体推理吞吐与成本的新工具。
- Vera Rubin 被定位为面向智能体 AI 的下一代系统,而非简单 GPU 迭代。
为什么重要
- 首次片上实测意味着 Vera Rubin 不再只是纸面发布,而是有真实负载数据支撑。
- 成本降 35 倍、吞吐升 30 倍,直接冲击智能体规模化落地的算力经济学。
- 与已有卡片相比,本条增量信息包括:每百万 Token 成本最高降 35 倍的量化结果、AgentX 测试细节、性能来源的四个协同设计,以及同期 Groq LPX 和 Agent 专用 Vera CPU 的生态动态。
局限与不确定性
- 材料未给出测试环境、模型版本(DeepSeek-V4-Pro 具体参数)、对比基准的完整配置,具体“最高”倍数对应的工况待核实。
- “SpaceXAI 规模化部署并计划送上太空”的表述来自原文,未提供更多细节,待核实。
- AgentX 测试的具体方法、评测代码是否公开,材料未说明。
- 每百万 Token 成本降 35 倍的计算口径(是否包含硬件、能源、模型授权等)待核实。
可用于图书/PPT/简报的角度
- 从“旧基准失效”切入,说明 Agent 时代需要新评测体系。
- 数据中心从“卖芯片”到“卖吞吐/Token成本”的叙事。
- 英伟达与 Groq 等专用推理芯片的竞争格局。
- Vera Rubin 作为“Agent专用系统”的定位,以及 CPU、GPU、NVLink 的协同创新。
与既有脉络的关系
已有卡片《NVIDIA Rubin GPU架构:驱动智能体AI时代》和《NVIDIA Vera Rubin 与 Blackwell 树立智能体 AI 每瓦性能新标准》分别介绍了 Rubin GPU 架构和 8 月 25 日预览的每瓦性能数据。本条卡片是基于 8 月 26 日腾讯研究院 AI 速递的更新,补充了首次片上实测、成本降幅、AgentX 测试细节和同期生态动态,因此与既有卡片构成“预览→实测”的延续关系。
原始材料
腾讯研究院AI速递 20260826,来源:https://m.sohu.com/a/1067538635_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=1