知识卡片:Qwen3.8-Flash-Next 176B 在 NVIDIA GB300 NVL72 上的智能体编码实验
一句话结论
Alibaba 发布的 Qwen3.8-Flash-Next 预览模型,以 176B 总参数量、6B 每 token 激活参数,结合 Gated DeltaNet 与 Qwen Sparse Attention 的混合架构,在 NVIDIA GB300 NVL72 上可实现每 GPU 超 16K tokens/s、每用户超 200 tokens/s 的吞吐,面向 agentic coding 等长上下文、高并发场景。
事件概述 / 研究问题
NVIDIA 技术博客于 2026 年 8 月 26 日发文,介绍 Alibaba 开放 Qwen3.8-Flash-Next 模型权重。该模型被视为即将到来的 Qwen4 架构的预览版本,供开发者实验和评估。NVIDIA 在 GB300 NVL72 上提供 Day 0 推理支持,并配套 NeMo 微调、强化学习及多推理栈方案。
研究问题聚焦于长上下文推理中的两个瓶颈:attention 计算量随序列增长而扩大,KV cache 内存占用随上下文增长而膨胀。Qwen3.8-Flash-Next 的混合架构试图同时缓解这两个问题。
方法/产品要点
- 模型规模:多模态 mixture-of-experts(MoE),总参数 176B,其中包含 51B N-gram embedding 参数,每 token 激活 6B 参数。
- 上下文窗口:原生 262,144 token,可通过 YaRN 扩展到 1M token。
- 混合架构:每四层中三层使用 Gated DeltaNet(GDN),将历史上下文压缩为固定大小的循环状态,避免 KV cache 随序列增长;剩余一层使用 Qwen Sparse Attention(QSA),在全上下文范围内进行精确检索。
- QSA 机制:将序列聚合成 micro-blocks,在 block 级别估计重要性并选择相关区域,而非依赖 token 级索引器,从而降低 attention、计算和索引开销。
- 部署硬件:NVIDIA GB300 NVL72 为 72 颗 Blackwell Ultra GPU 的机架级平台,NVLink 域支持 130 TB/s 全互联。
- 本地运行:还支持 NVIDIA DGX Station、DGX Spark 集群,以及搭载四张 NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition GPU 的工作站。
- 后训练:支持 NVIDIA NeMo AutoModel 进行 full SFT 或 LoRA 微调,并可使用 NVIDIA NeMo RL recipes 做强化学习。
- 推理栈:支持 SGLang、vLLM、TokenSpeed,同时 NVIDIA 提供 SGLang、vLLM、TensorRT LLM 的 Day 0 功能支持。
- 获取方式:可通过 QwenCloud 试用,从 Hugging Face 或 ModelScope 下载权重。
主要结果或产业意义
- 在 GB300 NVL72 上,Qwen3.8-Flash-Next 达到每 GPU 超 16K tokens/s 的峰值吞吐,每用户超 200 tokens/s。
- Alibaba 公布的基准显示,与全 attention 相比,QSA attention kernel 在 1M token 负载下最高可实现 7.6x prefill 和 4.9x decoding 加速。
- 在 1M token 上下文、90% prefix-cache hit rate 的在线服务测试中,Qwen3.8-Flash-Next 的 prefill 吞吐达到 Qwen3.7-Plus 的 8.6 倍。
- 该模型适合 agentic coding、文档处理、工具驱动工作流等上下文密集型应用,也展示了一条从本地原型验证到机架级生产部署的路径。
为什么重要
这是 NVIDIA 平台对第三方 Qwen 预览模型的一次生态级验证,而不是 NVIDIA 自研模型。增量信息在于:Qwen3.8-Flash-Next 为 Qwen4 架构探路,其 GDN+QSA 混合设计代表长上下文模型的一种新思路;NVIDIA 不仅给出 GB300 NVL72 上的吞吐数字,还提供 NeMo 后训练和多种推理栈支持,使开发者可以快速实验并评估 agentic coding 工作流。
与既有脉络的关系
已有相关卡片覆盖 Cohere North Mini Code、NVIDIA Nemotron 3 Ultra 和 Meta Muse Glimmer。本条不是这些模型的延续,而是新增的第三方模型与 NVIDIA 硬件组合案例。与 Nemotron 3 Ultra 聚焦 RTL 编码不同,Qwen3.8-Flash-Next 面向更通用的 agentic coding、文档处理和工具驱动场景,其核心增量是长上下文混合架构和 Qwen4 预览属性。
局限与不确定性
- 该模型是 preview release,不代表最终版 Qwen4。
- Alibaba 给出的 QSA 加速比和吞吐数据来自模型厂商,NVIDIA 博客未提供独立复现细节,具体评测条件需要核实。
- NVIDIA 博客的 AI 生成摘要明确提示“内容可能不完整,重要信息请自行核实”。
- “Day 0 functional support”是 NVIDIA 提供的尽力而为功能支持,不等同于所有推理栈均已生产级完全验证。
- GB300 NVL72 上“每 GPU 超 16K tokens/s”“每用户超 200 tokens/s”的具体 batch、并发和硬件配置细节未完全展开,待核实。
可用于图书/PPT/简报的角度
- 长上下文智能体编码的算力需求与架构选择。
- MoE 模型如何用少量激活参数支撑超大总参数。
- Gated DeltaNet 与稀疏注意力混合:在“记忆压缩”和“完整检索”之间取平衡。
- 从单机到机架级:Qwen 预览模型在 NVIDIA 平台上的本地开发与生产部署路径。
- 第三方模型与 NVIDIA 生态的 Day 0 合作模式。
原始材料
- 英文标题:Experiment with Qwen3.8-Flash-Next 176B Model on NVIDIA GB300 NVL72 for Agentic Coding
- 英文关键词:Agentic Coding; Qwen3.8-Flash-Next; NVIDIA GB300 NVL72; Mixture of Experts; Gated DeltaNet; Qwen Sparse Attention; Long Context; NeMo AutoModel
- 来源:NVIDIA Technical Blog
- 作者:Rajath Narasimha
- 发布时间:Aug 26, 2026
- URL:https://developer.nvidia.com/blog/experiment-with-qwen3-8-flash-next-176b-model-on-nvidia-gb300-nvl72-for-agentic-coding