知识卡片:NVIDIA Nemotron 3.5 Lightning:为长时运行代理提供快速、准确的专用任务执行
一句话结论
NVIDIA Nemotron 3.5 Lightning 是一个专为“始终在线”AI 代理的高频执行层设计的开放 30B Mixture-of-Experts(MoE)模型,仅激活 3B 参数,在保持较高准确率的同时可提供相比同类模型最高 4 倍的输出速度,并支持本地部署与模型路由。
英文标题
NVIDIA Nemotron 3.5 Lightning Delivers Fast, Accurate Specialized Task Execution for Long-Running Agents
英文关键词
Agentic AI;Generative AI;Nemotron;Mixture of Experts(MoE);Speculative Decoding;NeMo Switchyard;NVFP4;DGX Spark;Open Source
事件概述或研究问题
长时运行 AI 代理的大部分时间花费在高吞吐执行任务上,例如工具调用、结果验证和子代理委派。如果每一步都用前沿推理模型处理,成本和延迟都很高。NVIDIA 于 2026 年 8 月发布 Nemotron 3.5 Lightning,目标是在代理工作流中承担“执行层”工作,让更小的高效模型处理高频、低延迟任务,而像 Nemotron 3 Ultra 这样的前沿推理模型负责编排和复杂规划。
方法/产品要点
- 模型规格:开放 30B MoE 模型,3B 激活参数;是 Nemotron 3 系列中最小的成员。
- MoE 架构:路由器只将每个 token 发送给少数专家,每次推理仅运行少量参数,从而以大模型容量、小模型计算成本执行。
- 推测解码(Speculative Decoding):训练阶段内置多 token 预测(MTP),并有专门的 MTP 增强阶段;同时发布 DSpark 与 DFlash 两个草稿模型,适配不同并发场景。
- Harness 优化训练:针对主流 agent harness(如 OpenClaw、Hermes Agent)进行训练,提高工具调用准确率并降低延迟。
- 量化支持:提供 NVFP4 和 BF16 检查点,NVFP4 内核支持 Blackwell、Hopper、Ampere GPU,可在数据中心和 DGX Spark 上使用。
- NeMo Switchyard:新引入的模型路由库,可将 Nemotron 3.5 Lightning 作为路由目标,与开放/闭源模型共同部署,按任务分配合适模型。
- 开源与定制:权重、数据、训练配方以 OpenMDW-1.1 许可发布;支持 NeMo Automodel、NeMo Megatron Bridge 进行 LoRA 或全量 SFT,支持 NeMo RL 和 NeMo Gym 进行强化学习与评估。
- 本地部署:面向 NVIDIA Jetson、GeForce RTX 5090、DGX Spark 等本地硬件;支持 LM Studio、llama.cpp、Ollama、Unsloth 等行业工具。
主要结果或产业意义
- 在 Artificial Analysis Intelligence Index 上,Nemotron 3.5 Lightning 在“准确率-速度”Pareto 前沿上领先同类小规模开放模型。
- 在 PinchBench 上,模型达到 86% 准确率,完成 10,000 个任务时比准确率相近的 Qwen3.6 35B 快 30%。
- 相比类似大小的模型,输出速度最高提升 4 倍,适合高容量、低延迟的代理执行场景。
- 开放许可和广泛的合作伙伴生态(包括 harness、推理软件、云平台、服务商等)使其易于集成和定制。
为什么重要
Nemotron 3.5 Lightning 是“系统化模型”分工趋势的一个例子:不是所有任务都需要前沿推理模型。它为长时运行代理的执行层提供了一个开放、快速、可本地部署的选择,并可与 Nemotron 3 Ultra 等模型形成编排/执行分层架构,降低 token 成本与延迟。与已有关于 Nemotron 3 Ultra 的卡片相比,本条聚焦于该系列新增的最小成员,其本身即针对执行层优化,而非通过外部 harness profile 改造大模型。
局限与不确定性
- 原文未披露在 Artificial Analysis Intelligence Index 和 PinchBench 之外的更多基准细节,例如具体评测配置、方差和对比模型的版本。
- 文中未明确“最高 4 倍输出速度”对应的硬件、批大小、并发数、量化方式等前提条件,实际性能需自行验证。
- PinchBench 上对比的 Qwen3.6 35B 的具体来源和评测设定待核实。
- “30% 更快完成 10,000 个任务”及“86% 准确率”是否覆盖全部任务类型、是否存在任务级偏向,材料未详细说明。
- 模型实际可商用范围与 OpenMDW-1.1 许可的具体限制,需查阅许可证原文。
可用于图书/PPT/简报的角度
- 用“执行层 vs 规划层”的模型分工来讲解 AI Agent 系统架构中的成本与延迟优化。
- 以 Nemotron 3.5 Lightning 为例,说明 MoE、推测解码、量化等推理加速技术如何协同工作。
- 展示“小模型 + 路由”在长时运行 Agent 中的产业价值,以及与前沿大模型的互补关系。
- 作为“开放模型在本地硬件上运行 Agent”的实践案例,覆盖从 Jetson 到数据中心的全场景。
原始材料
URL: https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents
来源标题: NVIDIA Nemotron 3.5 Lightning Delivers Fast, Accurate Specialized Task Execution for Long-Running Agents | NVIDIA Technical Blog
来源作者/日期: Chris Alexiuk, Chintan Patel; Aug 11, 2026