AI消息速览

Qwen3.8-Flash-Next 176B 在 NVIDIA GB300 NVL72 上的智能体编码实验

事件日期 2026-08-26 · 产业观察 · 已接受

事件日期2026-08-26
信息日期2026-08-26
入库日期2026-08-27
通道产业观察
状态已接受
来源NVIDIA 博客

知识卡片:Qwen3.8-Flash-Next 176B 在 NVIDIA GB300 NVL72 上的智能体编码实验

一句话结论

Alibaba 发布的 Qwen3.8-Flash-Next 预览模型,以 176B 总参数量、6B 每 token 激活参数,结合 Gated DeltaNet 与 Qwen Sparse Attention 的混合架构,在 NVIDIA GB300 NVL72 上可实现每 GPU 超 16K tokens/s、每用户超 200 tokens/s 的吞吐,面向 agentic coding 等长上下文、高并发场景。

事件概述 / 研究问题

NVIDIA 技术博客于 2026 年 8 月 26 日发文,介绍 Alibaba 开放 Qwen3.8-Flash-Next 模型权重。该模型被视为即将到来的 Qwen4 架构的预览版本,供开发者实验和评估。NVIDIA 在 GB300 NVL72 上提供 Day 0 推理支持,并配套 NeMo 微调、强化学习及多推理栈方案。

研究问题聚焦于长上下文推理中的两个瓶颈:attention 计算量随序列增长而扩大,KV cache 内存占用随上下文增长而膨胀。Qwen3.8-Flash-Next 的混合架构试图同时缓解这两个问题。

方法/产品要点

  • 模型规模:多模态 mixture-of-experts(MoE),总参数 176B,其中包含 51B N-gram embedding 参数,每 token 激活 6B 参数。
  • 上下文窗口:原生 262,144 token,可通过 YaRN 扩展到 1M token。
  • 混合架构:每四层中三层使用 Gated DeltaNet(GDN),将历史上下文压缩为固定大小的循环状态,避免 KV cache 随序列增长;剩余一层使用 Qwen Sparse Attention(QSA),在全上下文范围内进行精确检索。
  • QSA 机制:将序列聚合成 micro-blocks,在 block 级别估计重要性并选择相关区域,而非依赖 token 级索引器,从而降低 attention、计算和索引开销。
  • 部署硬件:NVIDIA GB300 NVL72 为 72 颗 Blackwell Ultra GPU 的机架级平台,NVLink 域支持 130 TB/s 全互联。
  • 本地运行:还支持 NVIDIA DGX Station、DGX Spark 集群,以及搭载四张 NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition GPU 的工作站。
  • 后训练:支持 NVIDIA NeMo AutoModel 进行 full SFT 或 LoRA 微调,并可使用 NVIDIA NeMo RL recipes 做强化学习。
  • 推理栈:支持 SGLang、vLLM、TokenSpeed,同时 NVIDIA 提供 SGLang、vLLM、TensorRT LLM 的 Day 0 功能支持。
  • 获取方式:可通过 QwenCloud 试用,从 Hugging Face 或 ModelScope 下载权重。

主要结果或产业意义

  • 在 GB300 NVL72 上,Qwen3.8-Flash-Next 达到每 GPU 超 16K tokens/s 的峰值吞吐,每用户超 200 tokens/s。
  • Alibaba 公布的基准显示,与全 attention 相比,QSA attention kernel 在 1M token 负载下最高可实现 7.6x prefill 和 4.9x decoding 加速。
  • 在 1M token 上下文、90% prefix-cache hit rate 的在线服务测试中,Qwen3.8-Flash-Next 的 prefill 吞吐达到 Qwen3.7-Plus 的 8.6 倍。
  • 该模型适合 agentic coding、文档处理、工具驱动工作流等上下文密集型应用,也展示了一条从本地原型验证到机架级生产部署的路径。

为什么重要

这是 NVIDIA 平台对第三方 Qwen 预览模型的一次生态级验证,而不是 NVIDIA 自研模型。增量信息在于:Qwen3.8-Flash-Next 为 Qwen4 架构探路,其 GDN+QSA 混合设计代表长上下文模型的一种新思路;NVIDIA 不仅给出 GB300 NVL72 上的吞吐数字,还提供 NeMo 后训练和多种推理栈支持,使开发者可以快速实验并评估 agentic coding 工作流。

与既有脉络的关系

已有相关卡片覆盖 Cohere North Mini Code、NVIDIA Nemotron 3 Ultra 和 Meta Muse Glimmer。本条不是这些模型的延续,而是新增的第三方模型与 NVIDIA 硬件组合案例。与 Nemotron 3 Ultra 聚焦 RTL 编码不同,Qwen3.8-Flash-Next 面向更通用的 agentic coding、文档处理和工具驱动场景,其核心增量是长上下文混合架构和 Qwen4 预览属性。

局限与不确定性

  • 该模型是 preview release,不代表最终版 Qwen4。
  • Alibaba 给出的 QSA 加速比和吞吐数据来自模型厂商,NVIDIA 博客未提供独立复现细节,具体评测条件需要核实。
  • NVIDIA 博客的 AI 生成摘要明确提示“内容可能不完整,重要信息请自行核实”。
  • “Day 0 functional support”是 NVIDIA 提供的尽力而为功能支持,不等同于所有推理栈均已生产级完全验证。
  • GB300 NVL72 上“每 GPU 超 16K tokens/s”“每用户超 200 tokens/s”的具体 batch、并发和硬件配置细节未完全展开,待核实。

可用于图书/PPT/简报的角度

  • 长上下文智能体编码的算力需求与架构选择。
  • MoE 模型如何用少量激活参数支撑超大总参数。
  • Gated DeltaNet 与稀疏注意力混合:在“记忆压缩”和“完整检索”之间取平衡。
  • 从单机到机架级:Qwen 预览模型在 NVIDIA 平台上的本地开发与生产部署路径。
  • 第三方模型与 NVIDIA 生态的 Day 0 合作模式。

原始材料

  • 英文标题:Experiment with Qwen3.8-Flash-Next 176B Model on NVIDIA GB300 NVL72 for Agentic Coding
  • 英文关键词:Agentic Coding; Qwen3.8-Flash-Next; NVIDIA GB300 NVL72; Mixture of Experts; Gated DeltaNet; Qwen Sparse Attention; Long Context; NeMo AutoModel
  • 来源:NVIDIA Technical Blog
  • 作者:Rajath Narasimha
  • 发布时间:Aug 26, 2026
  • URL:https://developer.nvidia.com/blog/experiment-with-qwen3-8-flash-next-176b-model-on-nvidia-gb300-nvl72-for-agentic-coding