知识卡片:用 NVIDIA NeMo Switchyard 在模型间路由 AI Agent 工作负载
一句话结论
NVIDIA NeMo Switchyard 通过“模型路由”机制,让 AI Agent 在任务执行过程中按需选择最合适的模型,在模型能力、成本与延迟之间取得平衡,从而避免“所有请求都发给最大模型”带来的浪费,也避免“一律使用小模型”造成的质量下降。
事件概述
本材料来自 NVIDIA 技术博客,发布于 2026 年 8 月 11 日,介绍 NeMo Switchyard 这一模型路由解决方案。文章指出,构建 AI Agent 并非选定一个模型就结束,不同模型各有优缺点与成本特征,且同一工作负载的不同步骤可能需要不同能力的模型。NeMo Switchyard 提供了一套“系统化模型池”的编排思路,使开发者可以在不重建应用的前提下,将 Agent 工作负载路由到专用模型或前沿模型上。
方法/产品要点
- 运行时路由:路由器评估每个请求及可用上下文,将任务发送给最适合该任务的模型,并依据任务要求、约束和策略进行决策。
- 路由决策信号来源:
- 模型能力:哪些模型能正确解决问题;
- 模型成本画像:每个模型相关的延迟与成本;
- 基础设施:保障可靠、无缝切换的系统级信号。
- 决策信号可从三类对象获取:
- 请求本身(如分类、嵌入特征);
- 模型状态(如 logprobs、级联、Agent 轨迹、残差流、注意力矩阵等);
- 系统信息(如定价、延迟、负载、错误等)。
- 架构分层:
NeMo switchyard-libsy:与模型提供商无关的 SDK,负责表示请求、定义可用模型、管理对所选模型的调用;语义模型名与具体 provider endpoint/model ID 分离,使路由逻辑不依赖特定提供商。- NeMo Switchyard server:作为 LLM 网关参考实现,支持 OpenAI、Anthropic、Responses API 请求格式,并记录所选模型、决策理由、token 用量、延迟与调用结果。
- 免调优路由器(Tuning-free routers):
- LLM classifier:用 LLM 作为裁判选择候选模型,并在后续轮次中维持会话亲和,避免重复分类。
- Stage router:根据编码 Agent 所处阶段(探索、恢复错误、机械实现等)和近期工具活动判断所需模型能力;严重错误、重复无效工作或长时间探索会路由到更强模型,稳态写入/编辑则倾向高效模型。
- Escalation router:对话先使用低成本模型,LLM 裁判逐轮监控进度,检测到持续困难时将会话升级到更强模型。
- 可调优路由器(Tunable routers):
- Prefill router:训练时提取 LLM 残差流估计查询复杂度,共享主干 MLP 映射到模型池中各模型的准确率标签;推理时用 prefill 状态预测各模型成功概率,并结合成本、延迟等约束打分,以最优权衡路由。
- 路由时机与粒度可选:可对每个完整请求路由,也可在 Agent 多轮任务的每一步路由;可共享模型池,也可让子 Agent 使用专用模型池;路由状态可按需跨会话保持或保持无状态。
主要结果
- 文章以 Terminal-Bench Hard 基准上的计算机使用任务为例说明:某个模型(如 DeepSeek V4)整体准确率最高,但并非对每个任务组都最优——例如 Kimi K2.6 在 ML 与 RL 任务组上更合适,Qwen3.5 397B A17B 在数学与科学任务上更合适,其余任务组用 DeepSeek V4 更好;同样的思路可细化到单个任务或单个任务的不同阶段。
- 图示展示了模型准确率与 token 消耗(prompt/output tokens)之间的权衡,说明成本、完成时间和“冗长度”都会影响路由决策。
- 可学习式 Prefill router 在个人助手类任务(Pinchbench + ClawdQA)上的实验显示:路由不只是选最强模型,而是选择“以合适成本达到所需质量水平”的模型。
- NVIDIA 正在与多个生态伙伴合作,包括 Cognition(编码 Agent 工作流)、Nous Research(Hermes Agent 模型路由)、Ramp(金融软件工程工作流)、LangChain(模型路由评估)、LiteLLM(LLM 应用栈插件)、Kong(AI 网关与流量管理)、Classmethod(Claude 模型路由)、Boomi Agent Garden(企业自动化)等。
- 文章称,基准测试和真实测试表明,使用 NeMo Switchyard 路由可以显著降低成本,同时保持高准确率。
为什么重要
- 传统 AI Agent 通常绑定单一模型,难以兼顾复杂任务的推理质量与简单任务的成本效率。NeMo Switchyard 将“模型路由”作为 Agent 工作负载的一等编排能力,使系统能够动态适应任务差异。
- 与既有相关卡片的增量关系:此前已有卡片分别涉及基于 NeMo 构建工业报警分析代理、用 RL Agent 技能自动运行研究工作流、以及 NVIDIA Vera CPU 加速智能体工作负载。本条信息的增量在于:它不聚焦某一具体 Agent 应用,而是提供了一个跨模型的“路由编排”层,可视为上述 Agent 工作负载的底层基础设施选项;同时它引入了“免调优 + 可调优”两类路由器设计,以及“路由决策可在多轮会话中跨步骤进行”的工程思路。
局限与不确定性
- 原文未提供端到端成本降低的具体百分比,只称“显著降低”,具体幅度待核实。
- Terminal-Bench Hard 上的示例结果及图 1、图 2 中的具体模型(DeepSeek V4、Kimi K2.6、Qwen3.5 397B A17B 等)来自原文,但未说明测试环境的完整细节、版本或复现方式,相关准确性数据待核实。
- Prefill router 的效果表现引用了 arXiv 论文(
https://arxiv.org/abs/2603.20895),但该论文在原文中仅作为链接出现,其方法与结论细节未在博客中展开,论文内容待核实。 - 路由本身可能引入额外延迟和复杂度,原文提到“系统还需要基础设施实现无缝、不可见的切换”,但未量化路由开销。
- 多轮会话中“会话亲和”和“升级路由”的具体触发阈值、错误判定标准等未在原文中给出,实现细节需进一步确认。
可用于图书/PPT/简报的角度
- 用“模型路由”替换“单一模型全家桶”的思维:为什么 AI Agent 需要一组模型而不是一个模型。
- 从“选模型”到“选路由策略”:免调优 vs 可调优路由器的适用场景差异。
- 以编码 Agent 为例:探索阶段用强模型、实现阶段用高效模型的“阶段路由”思路。
- 网关与 SDK 分离的架构设计:如何做到模型提供商无关。
- 企业落地意义:在保持准确率的前提下降低成本,适合与 LangChain、LiteLLM、Kong 等既有技术栈集成。
- 注意使用原文中的示例图(模型准确率 vs 成本/延迟散点)来说明“没有万能模型”。
原始材料
- 英文标题:Route AI Agents Across Models with NVIDIA NeMo Switchyard
- 英文关键词:Model routing, AI agents, NeMo Switchyard, routing algorithms, LLM gateway
- 来源:NVIDIA Technical Blog,作者 Tanay Varshney, Chris Alexiuk, Ayush Agarwal, Annie Surla, Moon Chung,发布于 2026 年 8 月 11 日
- URL:https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard