AI消息速览

Qwen3.8-2.4T-A95B 在 NVIDIA GB300 NVL72 上的可配置推理部署

事件日期 2026-08-12 · 产业观察 · 已接受

事件日期2026-08-12
信息日期2026-08-12
入库日期2026-08-13
通道产业观察
状态已接受
来源NVIDIA 博客

知识卡片:Qwen3.8-2.4T-A95B 在 NVIDIA GB300 NVL72 上的可配置推理部署

一句话结论

阿里巴巴开放了其最大开放权重模型 Qwen3.8-2.4T-A95B(Qwen3.8-Max)的权重;NVIDIA 与开源生态合作,使该模型在 GB300 NVL72 上无需额外调优即可于 Day 0 以 FP8 精度实现每 GPU 每秒超过 4K tokens、每用户每秒超过 350 tokens 的推理吞吐。

事件概述

Qwen3.8-2.4T-A95B 是阿里巴巴发布的最大开放权重模型,面向推理和智能体(agentic)工作负载设计。其总参数为 2.4T,每 token 激活 95B 参数;采用细粒度混合专家(MoE)架构,并混合使用全注意力与线性注意力。模型支持最高 100 万 token 的上下文窗口和最高 128K 的输出长度。

部署 2.4T 参数规模的开放权重模型需要数据中心级加速计算。NVIDIA 通过优化内核、推理运行时和分布式服务方案,与开源生态合作将模型带到多节点部署环境。

方法/产品要点

  • 模型架构:细粒度 MoE 将容量分布在更多更小的专家上,学习式路由器只激活每 token 所需专家,使服务成本与激活参数(95B)而非全量参数(2.4T)挂钩。
  • 长上下文处理:全注意力层与线性注意力层交替;线性注意力层用有界循环状态替代不断增长的 KV 缓存,使计算和内存随上下文扩展保持有界。
  • 可配置推理:内置低/高/超高(low/high/xhigh)推理控制,开发者可按请求调整推理深度,在高复杂度多步推理与高吞吐文档处理之间权衡。
  • 硬件平台:GB300 NVL72 集成 72 块 NVIDIA Blackwell Ultra GPU,NVLink 域支持 130 TB/s 全互联通信,缓解 MoE 专家流量跨网络瓶颈。
  • 软件栈:支持 SGLang、vLLM、NVIDIA Dynamo 等开源推理方案;也可通过 model-free NVIDIA NIM 容器部署;后训练可使用 NVIDIA NeMo AutoModel,支持 PyTorch 原生微调和 Hugging Face checkpoint 直接加载。

主要结果或产业意义

  • 模型在 NVIDIA GB300 NVL72 上开箱即用,无需额外模型调优即达到每 GPU 每秒超过 4K tokens、每用户每秒超过 350 tokens 的 FP8 推理吞吐。
  • 该成果使 AI 工厂能够以高吞吐和低延迟在生产环境中运行大参数模型。
  • 进一步优化(包括 NVFP4 精度)预计将随时间带来更明显的性能提升。
  • 产业意义在于:开放权重模型达到接近前沿能力的同时,通过细粒度 MoE 和硬件-软件协同设计,使超大模型的推理成本可被控制。

为什么重要

这是 2.4T 参数级别的开放权重模型在机架级加速平台上实现 Day 0 可服务的重要案例。它展示了从芯片、系统架构到推理软件的全栈协同设计如何支撑超大 MoE 模型的实际生产部署,也为智能体类应用(长上下文、多步骤工作流、工具调用等)提供了可行的开源模型路径。

局限与不确定性

  • 原文给出的吞吐数据为峰值/宣称值,未说明具体并发数、请求长度、批次大小等测试条件,实际性能待核实。
  • 未给出多节点部署的具体规模、扩展效率或端到端延迟数据。
  • NVFP4 精度带来的优化性能尚未实测,属于预期。
  • 模型为开放权重(open weights),但具体许可证条款和商用限制需另行核实。

可用于图书/PPT/简报的角度

  • 以“开源 2.4T 模型如何低成本跑起来”为案例,说明 MoE 架构与激活参数的关系。
  • 展示全注意力+线性注意力混合设计如何应对百万级 token 长上下文。
  • 作为硬件-软件协同设计在推理侧的代表性战例,与预训练场景形成对照。
  • 用于说明“AI 工厂”生产级推理吞吐的量化参考。

与既有脉络的关系

本条是 NVIDIA GB300 NVL72 平台能力在推理侧的新进展,与此前该平台在 DeepSeek-V3 671B 预训练上创下 MoE 世界纪录的卡片形成延续:同一平台既可用于超大模型训练,也可支撑超大开放权重模型的 Day 0 生产级推理。本条增量信息在于具体的模型适配、架构特点和推理吞吐结果。

原始材料

  • 英文标题:Serve Qwen3.8-2.4T-A95B, a 2.4T-Parameter Model, with Configurable Reasoning on NVIDIA GB300 NVL72
  • 英文关键词:Qwen3.8-2.4T-A95B, Qwen3.8-Max, Mixture of Experts (MoE), GB300 NVL72, Configurable Reasoning, SGLang, vLLM, NVIDIA Dynamo, NVIDIA NIM, NeMo AutoModel
  • 原始来源:NVIDIA Technical Blog,2026-08-12,作者 Amr Elmeleegy、HJ Hang、Rajath Narasimha
    https://developer.nvidia.com/blog/serve-qwen3-8-2-4t-a95b-a-2-4t-parameter-model-with-configurable-reasoning-on-nvidia-gb300-nvl72