AI消息速览

为 NVIDIA Nemotron 3 Ultra 创建 LangChain Deep Agents Harness Profile 以提升性能

事件日期 2026-07-09 · 产业观察 · 已接受

事件日期2026-07-09
信息日期2026-07-09
入库日期2026-07-09
通道产业观察
状态已接受
来源NVIDIA 博客

知识卡片:为 NVIDIA Nemotron 3 Ultra 创建 LangChain Deep Agents Harness Profile 以提升性能

一句话结论

通过为 NVIDIA Nemotron 3 Ultra 构建定制的 LangChain Deep Agents harness profile(如添加 ReadFileContinuationNoticeMiddleware 中间件),可在不进行微调的情况下提升开源模型的 agent 准确性,使其接近专有前沿模型的水平。

事件概述或研究问题

Agent 系统通常面临准确性-成本的权衡:专有前沿模型与 harness 准确性高但成本昂贵。微调是改善方法之一,但需要专业知识、硬件和定制模型托管。本文探索一种替代方案——harness 工程(harness engineering):通过修改 agent harness 的提示、添加/移除中间件或子 agent,使模型调用更接近训练数据,从而在不微调模型本身的情况下提升性能。该过程依赖两个新发展:为特定 harness 构建的评估基准,以及 per-model 定制入口点(如 LangChain 的 agent harness profiles)。

方法/产品要点

  • Harness Profile:LangChain Deep Agents 提供的扩展点,允许开发者基于模型改变 agent harness 的行为。支持修改:系统提示(prompt)、排除工具/中间件、添加中间件或子 agent。
  • 手动调优循环
    1. 使用基准评估运行基线(无 profile);
    2. 分析失败案例;
    3. 对 harness profile 提出修改(如提示调整、中间件插入);
    4. 重新运行基准验证改进,同时检查回归。
  • 中间件示例ReadFileContinuationNoticeMiddleware——当 read_file 工具返回的行数等于限制时,自动追加提示信息,指导模型继续分页读取。
  • 自动化改进循环:类似“ralph loop”——模型读取当前状态,做单一修改,以文件系统作为记忆。循环通过评估基准提供的真实验证信号自动迭代。LangSmith Engine 是 LangChain 的托管版实现,可检测生产跟踪中的失败、诊断根因、起草修复并添加评估器。
  • 关键约束防过拟合:每次修改需多次通过同一测试才被接受;快照与回滚机制;仅允许修改 profile 文件;倾向通用修复而非特定案例 hack;可保留验证集做 hold-out 测试。

主要结果或产业意义

配置 read_file 测试 整体评估基准
基线 0/3 平均 94/127
添加文件中间件 3/3 平均 96/127

结果:中间件解决了所有三个失败的 read_file 测试,并将整体评估基准分数从 94/127 提升至 96/127。这表明通过 harness profile 工程,开源模型(Nemotron 3 Ultra)的 agent 性能可逼近专有模型,且成本更低。

为什么重要

  • 为缺乏微调资源或能力的团队提供了一条低成本、高效率的 agent 优化路径。
  • 展示了“harness 工程”作为一种系统化的方法,可机械化 agent 优化过程并减少过拟合风险。
  • 自动化循环(如 LangSmith Engine)可实现自我修正的 profile 改进,支持跨不同 agent 框架的模型适配。

局限与不确定性

  • 手动调优和自动化循环均依赖高质量的评估基准;基准设计不合理可能导致过拟合或无效改进。
  • 文中提到需注意过拟合:例如将“incident alerts”与“incident triage”的语义区别直接写入 harness 可能过度特化。
  • 结果基于特定模型(Nemotron 3 Ultra)和特定 harness(LangChain Deep Agents),普适性有待验证。
  • 自动化循环中的“agentic proposer”使用 LLM 本身来提议修改,可能引入新的偏差或随机性。
  • 待核实:实际生产环境中性能提升的幅度、不同模型/框架下的泛化能力。

可用于图书/PPT/简报的角度

  • 技术实践:展示如何通过“中间件”模式解决 agent 工具调用中的常见故障(如分页读取)。
  • 方法论:介绍“harness 工程”作为微调的替代或补充策略,适合资源受限场景。
  • 自动化:agent 自我改进循环的设计原则(验证-回滚-全套回归),可作为 LLM 应用中稳定迭代的参考范式。
  • 成本效益:对比专有模型的高成本 vs 开源模型+harness 优化的低成本方案。

原始材料

URL: https://developer.nvidia.com/blog/create-a-langchain-deep-agents-harness-profile-for-nvidia-nemotron-3-ultra-to-improve-performance
英文标题: Create a LangChain Deep Agents Harness Profile for NVIDIA Nemotron 3 Ultra to Improve Performance
英文关键词: agent, harness engineering, NVIDIA Nemotron 3 Ultra, LangChain Deep Agents, evaluation benchmark, overfitting, middleware
来源: NVIDIA Technical Blog, July 8, 2026, by Sean Lopp, Matthew Penn, Sukrit Rao