知识卡片:NVIDIA GB300 NVL72 创MoE预训练世界纪录:每GPU 1,648 TFLOPs
一句话结论
NVIDIA GB300 NVL72 以每 GPU 1,648 TFLOPs 的吞吐量,在 DeepSeek-V3 671B 模型预训练上创下世界纪录,硬件-软件全栈协同设计使六个月内纯软件优化再提升 1.5 倍性能。
事件概述
2026 年 7 月 21 日,NVIDIA 官方宣布,其 GB300 NVL72 机架级 AI 系统在预训练混合专家(MoE)模型 DeepSeek-V3 671B 时,实现了每 GPU 1,648 TFLOPs 的交付吞吐量,刷新行业纪录。该成绩得益于第五代 NVLink 互联、ConnectX-8 SuperNIC、BlueField DPU 以及 Megatron Core、TorchTitan、JAX 等软件框架的联合优化。
方法/产品要点
- 系统架构:GB300 NVL72 为机架级系统,内部 72 块 NVIDIA Blackwell Ultra GPU 通过第五代 NVLink 紧密耦合,每 GPU 提供 1.8 TB/s 带宽,机架内全对全非阻塞带宽达 130 TB/s;NVLink 为内存语义互联,GPU 可直接以硬件访存方式读写对端 HBM,延迟极低。
- 扩展网络:跨机架扩展使用 NVIDIA ConnectX-8 SuperNIC(每 GPU 800 Gb/s)配合 Quantum-X800 InfiniBand 或 Spectrum-X Ethernet,确保梯度通信在计算窗口内完成。
- 基础设施处理:BlueField DPU 隔离虚拟网络、存储、安全、遥测等负载,降低主机 CPU 开销。
- 软件生态:
- Megatron Core:NVIDIA 自有训练框架,针对 GPU 深度调优。
- TorchTitan:PyTorch 原生训练栈,经 NVIDIA 贡献优化后性能提升约 6 倍(同硬件)。
- JAX:NVIDIA 贡献的优化使六个月后性能提升近 10 倍,达到 1,025 TFLOPs/GPU。
- 可扩展性:从 256 GPU 扩展至 1024 GPU 时,Megatron Core 保持 98.5% 的每 GPU 性能,TorchTitan 和 JAX 均保持 97%,加装更多 GPU 几乎线性提升系统总吞吐。
主要结果
- 256 GPU 下 DeepSeek-V3 671B 预训练:1,648 TFLOPs/GPU,较上一代 GB200 NVL72(早期软件)的 606 TFLOPs/GPU 提升约 3 倍。
- 同一 GB300 NVL72 硬件上,纯软件优化在 6 个月内使性能再提升 1.5 倍。
- 开放框架 TorchTitan 和 JAX 在相同硬件上的性能分别提升约 6 倍 和 近 10 倍(均为 256 GPU 规模,对比早期软件版本)。
为什么重要
MoE 架构已成为前沿模型预训练的主流选择,其通信瓶颈限制扩展效率。NVIDIA GB300 NVL72 展示了通过全栈协同(芯片、互联、网络、软件)可突破该瓶颈,在保持高扩展效率的同时实现每 GPU 吞吐的跳跃式增长。这一结果延续了 NVIDIA 在大型 AI 训练基础设施上的持续领先,增量信息在于量化了从 GB200 到 GB300 的单代性能跃升以及纯软件优化的长期红利。
局限与不确定性
- 性能数据为 NVIDIA 内部测试结果,实际用户部署可能因集群规模、网络拓扑、软件版本等略有差异。
- 纪录基于 DeepSeek-V3 671B 单一模型,其他 MoE 模型或非 MoE 模型表现需另行验证。
- 软件优化仍在持续推进,当前纪录并非天花板,未来可能被后续软硬件版本超越。
可用于图书/PPT/简报的角度
- MoE 训练的关键挑战:通信成为新瓶颈,NVLink 和全栈设计如何解决。
- 硬件-软件协同设计的价值:单代硬件带来 3 倍提升,后续软件再贡献 1.5 倍。
- 开放框架加速:NVIDIA 对 TorchTitan、JAX 的贡献使社区直接受益。
- 扩展效率指标:97% 以上的弱扩展效率说明机架级互联的有效性。
原始材料
- 英文标题:Setting a World Record for MoE Pre-Training on NVIDIA GB300 NVL72
- 英文关键词:MoE pre-training, NVIDIA GB300 NVL72, DeepSeek-V3, world record, NVLink, Megatron Core, TorchTitan, JAX, Blackwell Ultra, ConnectX-8, BlueField DPU
- 原始来源:https://developer.nvidia.com/blog/setting-a-world-record-for-moe-pre-training-on-nvidia-gb300-nvl72