知识卡片:Qwen3.8-2.4T-A95B 在 NVIDIA GB300 NVL72 上的可配置推理部署
一句话结论
阿里巴巴开放了其最大开放权重模型 Qwen3.8-2.4T-A95B(Qwen3.8-Max)的权重;NVIDIA 与开源生态合作,使该模型在 GB300 NVL72 上无需额外调优即可于 Day 0 以 FP8 精度实现每 GPU 每秒超过 4K tokens、每用户每秒超过 350 tokens 的推理吞吐。
事件概述
Qwen3.8-2.4T-A95B 是阿里巴巴发布的最大开放权重模型,面向推理和智能体(agentic)工作负载设计。其总参数为 2.4T,每 token 激活 95B 参数;采用细粒度混合专家(MoE)架构,并混合使用全注意力与线性注意力。模型支持最高 100 万 token 的上下文窗口和最高 128K 的输出长度。
部署 2.4T 参数规模的开放权重模型需要数据中心级加速计算。NVIDIA 通过优化内核、推理运行时和分布式服务方案,与开源生态合作将模型带到多节点部署环境。
方法/产品要点
- 模型架构:细粒度 MoE 将容量分布在更多更小的专家上,学习式路由器只激活每 token 所需专家,使服务成本与激活参数(95B)而非全量参数(2.4T)挂钩。
- 长上下文处理:全注意力层与线性注意力层交替;线性注意力层用有界循环状态替代不断增长的 KV 缓存,使计算和内存随上下文扩展保持有界。
- 可配置推理:内置低/高/超高(low/high/xhigh)推理控制,开发者可按请求调整推理深度,在高复杂度多步推理与高吞吐文档处理之间权衡。
- 硬件平台:GB300 NVL72 集成 72 块 NVIDIA Blackwell Ultra GPU,NVLink 域支持 130 TB/s 全互联通信,缓解 MoE 专家流量跨网络瓶颈。
- 软件栈:支持 SGLang、vLLM、NVIDIA Dynamo 等开源推理方案;也可通过 model-free NVIDIA NIM 容器部署;后训练可使用 NVIDIA NeMo AutoModel,支持 PyTorch 原生微调和 Hugging Face checkpoint 直接加载。
主要结果或产业意义
- 模型在 NVIDIA GB300 NVL72 上开箱即用,无需额外模型调优即达到每 GPU 每秒超过 4K tokens、每用户每秒超过 350 tokens 的 FP8 推理吞吐。
- 该成果使 AI 工厂能够以高吞吐和低延迟在生产环境中运行大参数模型。
- 进一步优化(包括 NVFP4 精度)预计将随时间带来更明显的性能提升。
- 产业意义在于:开放权重模型达到接近前沿能力的同时,通过细粒度 MoE 和硬件-软件协同设计,使超大模型的推理成本可被控制。
为什么重要
这是 2.4T 参数级别的开放权重模型在机架级加速平台上实现 Day 0 可服务的重要案例。它展示了从芯片、系统架构到推理软件的全栈协同设计如何支撑超大 MoE 模型的实际生产部署,也为智能体类应用(长上下文、多步骤工作流、工具调用等)提供了可行的开源模型路径。
局限与不确定性
- 原文给出的吞吐数据为峰值/宣称值,未说明具体并发数、请求长度、批次大小等测试条件,实际性能待核实。
- 未给出多节点部署的具体规模、扩展效率或端到端延迟数据。
- NVFP4 精度带来的优化性能尚未实测,属于预期。
- 模型为开放权重(open weights),但具体许可证条款和商用限制需另行核实。
可用于图书/PPT/简报的角度
- 以“开源 2.4T 模型如何低成本跑起来”为案例,说明 MoE 架构与激活参数的关系。
- 展示全注意力+线性注意力混合设计如何应对百万级 token 长上下文。
- 作为硬件-软件协同设计在推理侧的代表性战例,与预训练场景形成对照。
- 用于说明“AI 工厂”生产级推理吞吐的量化参考。
与既有脉络的关系
本条是 NVIDIA GB300 NVL72 平台能力在推理侧的新进展,与此前该平台在 DeepSeek-V3 671B 预训练上创下 MoE 世界纪录的卡片形成延续:同一平台既可用于超大模型训练,也可支撑超大开放权重模型的 Day 0 生产级推理。本条增量信息在于具体的模型适配、架构特点和推理吞吐结果。
原始材料
- 英文标题:Serve Qwen3.8-2.4T-A95B, a 2.4T-Parameter Model, with Configurable Reasoning on NVIDIA GB300 NVL72
- 英文关键词:Qwen3.8-2.4T-A95B, Qwen3.8-Max, Mixture of Experts (MoE), GB300 NVL72, Configurable Reasoning, SGLang, vLLM, NVIDIA Dynamo, NVIDIA NIM, NeMo AutoModel
- 原始来源:NVIDIA Technical Blog,2026-08-12,作者 Amr Elmeleegy、HJ Hang、Rajath Narasimha
https://developer.nvidia.com/blog/serve-qwen3-8-2-4t-a95b-a-2-4t-parameter-model-with-configurable-reasoning-on-nvidia-gb300-nvl72