AI消息速览

使用 NVIDIA Model Optimizer 通过 QAD 开发 Nemotron 3.5 Lightning NVFP4

事件日期 2026-08-17 · 产业观察 · 已接受

事件日期2026-08-17
信息日期2026-08-17
入库日期2026-08-18
通道产业观察
状态已接受
来源NVIDIA 博客

知识卡片:使用 NVIDIA Model Optimizer 通过 QAD 开发 Nemotron 3.5 Lightning NVFP4

一句话结论

NVIDIA 发布了 Nemotron 3.5 Lightning 的 NVFP4 量化检查点,采用“量化感知蒸馏(QAD)”流程,在保持接近 BF16 基线精度的同时,将模型从 66 GB 压缩至 22 GB,并实现最高约 4 倍吞吐提升。

事件概述

NVIDIA 技术博客(2026-08-17)介绍了如何使用 NVIDIA Model Optimizer 和 Megatron-Bridge,通过 QAD 训练流程开发 Nemotron 3.5 Lightning NVFP4 检查点。该方法面向需要更低内存、更高吞吐但对精度敏感的自定义部署场景。

方法/产品要点

  • QAD 两阶段流程
    1. 后训练量化(PTQ):将 BF16 全精度教师模型量化到 W4A16/NVFP4,生成低精度学生检查点。
    2. 量化感知蒸馏:冻结教师模型,学生模型在模拟量化环境中前向传播,同时使用 KL 散度损失对齐教师 logits,恢复激进量化带来的精度损失。
  • 量化策略:对 Mamba 线性层采用更激进的 W4A16(而非 FP8),lm_head 量化为 W4A16,注意力投影层保持 BF16;KV cache 可选择 NVFP4。
  • PTQ 配方:比较了 5 种配方(max、mamba_fp8_max、MSE、four_over_six、four_over_six + NVFP4 KV),其中 four_over_six 在精度损失和推理性能间取得最佳平衡。校准序列长度实验表明 32K 效果最好。
  • QAD 训练配置:初始消融用 256K 序列长度,最终 QAD 运行扩展到 522K(原文表述为 sequence length 522K);数据集推荐参考 NVIDIA 开源的 Nemotron-Post-Training v1/v2;学习率 5e-6,无 warmup,关闭 dropout,梯度裁剪 1.0,使用 2 节点 × 8 GPU(TP=2, EP=4)。
  • 目标精度恢复范围:PTQ-only 通常追求 >99% 中位精度恢复;配合 QAD 时,PTQ 阶段可放宽到 95–99%,留下空间给 QAD 恢复。
  • 复现工具:NVIDIA Model Optimizer 提供 Hugging Face PTQ 示例和 QAD 端到端示例。

主要结果或产业意义

  • NVFP4 检查点从 66 GB 压缩到 22 GB,解锁最高约 4 倍吞吐提升。
  • 实验显示 QAD 在多个 Lightning 检查点上一致优于纯 PTQ,在中位精度恢复、agentic 和 coding 基准上表现更好。
  • QAD 允许采用比 PTQ-only 更激进的量化设置(如 Mamba 线性层 W4A16、KV cache NVFP4),从而在不明显损失精度的情况下大幅降低内存和计算开销。

为什么重要

  • 这是 NVIDIA 开源模型生态中,用 QAD 将混合架构(Mamba + Transformer)大模型压缩到 4-bit 权重的公开技术案例。
  • 与已有相关卡片中“Nemotron 3 Nano 使用托管 RL 微调”相比,本条增量信息是:Nemotron 3.5 Lightning 的 NVFP4 版本通过 Model Optimizer 的 QAD 流程实现,强调量化感知蒸馏而非 RL 微调,且给出了详细配方和可复现工具链。

局限与不确定性

  • 文章内容为 NVIDIA 技术博客自述,未提供独立第三方评测。
  • 内部数据集混合未完全公开;论文引用 arXiv:2512.02010,但完整细节需进一步核实。
  • 原文中“522K”在上下文中既出现为 tokens 又出现为 sequence length,具体单位表述存在待核实之处。
  • 实际部署吞吐和精度收益可能因硬件、模型版本和任务而异。

可用于图书/PPT/简报的角度

  • 大模型量化新范式:从 PTQ 到量化感知蒸馏(QAD)的升级路径。
  • 如何在不牺牲精度的前提下,把 66 GB 模型压到 22 GB 并提速 4 倍。
  • NVIDIA Model Optimizer 工具链在混合架构(Mamba + Transformer)上的量化实践。
  • 开源模型部署中的“精度-内存-吞吐”权衡与工程配方。

原始材料

  • 英文标题:Developing Nemotron 3.5 Lightning NVFP4 with QAD Using NVIDIA Model Optimizer
  • 英文关键词:NVIDIA Model Optimizer, Quantization-Aware Distillation, NVFP4, Nemotron 3.5 Lightning, PTQ
  • 来源:NVIDIA Technical Blog, Aug 17, 2026
  • URL: https://developer.nvidia.com/blog/developing-nemotron-3-5-lightning-nvfp4-with-qad-using-nvidia-model-optimizer