知识卡片:NOOA:面向对象的智能体框架与六大夹具能力
一句话结论:NVIDIA Labs 发布 NOOA(NVIDIA Labs Object-Oriented Agents)——一个开源的面向对象智能体框架,将智能体定义为单一 Python 类,通过六大模型接口能力在不微调模型的情况下显著提升智能体性能,在 SWE-bench Verified、CyberGym L1 和 ARC-AGI-3 上达到当时最佳或接近最佳的水平,同时将 token 成本降低约一半。
事件概述
2026 年 7 月 27 日,NVIDIA 技术博客介绍了 NVIDIA Labs 的研究预览产品 NOOA。该框架的核心观点是:智能体的性能不仅取决于底层模型,还很大程度上取决于“夹具”(harness)——即围绕模型构建的架构,包括上下文渲染、动作执行、状态管理和任务终止判断。NOOA 通过将智能体建模为单一 Python 类,利用类型注解和代码即行动的思路,实现了六大模型面向的接口能力,并在多个基准上验证了效果和效率。
方法/产品要点
- 智能体即单个 Python 对象:智能体是一个 Python 类,其方法代表能力,字段代表状态,文档字符串代表提示,类型注解作为强制契约。方法体若为省略号(
...),则在运行时由 LLM 驱动的循环完成;若为正常代码,则像普通 Python 一样执行。 - 六大模型面向的夹具能力:
- 类型化输入/输出(Typed I/O)
- 传引用(Pass by reference)
- 代码即行动(Code as action)
- 可编程循环工程(Programmable loop engineering)
- 显式对象状态(Explicit object state)
- 模型可调用的 API(Model-callable harness APIs)
- 自策划长期记忆:智能体通过模型可调用的工具主动写入、查询、修正记忆,记忆存储在人类可读的 SQLite 文件中,支持类型、重要性、标签及关系(如“支持”、“矛盾”、“派生自”),构成知识图谱。后台反射(reflection)过程会合并重复、链接相关记录、提炼见解并裁汰过时信息。记忆跨会话累积,无需重新训练。
- 无需上下文压缩:由于传引用机制,工具结果直接作为实时 Python 变量,而非序列化到上下文中,因此会话记录保持追加模式,预填充缓存有效,无需摘要压缩。
主要结果或产业意义
| 基准 | 模型 | 成绩 | 关键对比 |
|---|---|---|---|
| SWE-bench Verified | GPT-5.5 | 82.2% | 超过提交时排行榜 SOTA 79.2%;Opus 4.6 达 79.8% |
| CyberGym L1 | GPT-5.5 | 86.8% | 最高分开源智能体,超过多数闭源系统;无网络访问、规则检查“作弊” |
| ARC-AGI-3 | GPT-5.5 | 50.2% 平均 RHAE | 记忆子系统比文件笔记提升 +11.8 分;技能基线提升 +8.5 分 |
| ARC-AGI-3 | GPT-5.6-sol | 85.1% 平均 RHAE | 每局成本约 $13.3,25 局中 19 局完全解决 |
效率:在 SWE-bench Verified 上,NOOA with GPT-5.5 使用 29 次 LLM 调用和约 1.1M token/任务,达到 82.2%;对比夹具需要 66 次调用和 2.2M token 达到 78.2%,或 29 次调用 1.3M token 达到 78.6%。即 NOOA 以约一半的成本达到相同或更优成绩。
内部研究:在漏洞发现(CyberGym L1)中,NOOA 将验证流水线实现为一个单一对象,确定性检查与模型推理共存于同一类型对象中,最终解决率 86.8%。
为什么重要
- NOOA 以极端简洁的面向对象方式重新定义了智能体开发,使智能体开发回归传统软件开发流程(可 diff、代码审查、单元测试、版本控制等),降低了工程门槛。
- 验证了夹具工程(harness engineering)本身即可带来双位数的基准分数提升和显著的 token 节省,无需微调模型——这与已有相关卡片(如为 NVIDIA Nemotron 3 Ultra 创建 LangChain Deep Agents 夹具配置文件)的思路一致,但 NOOA 提供了更通用、跨模型的框架设计,并在不同基准上给出了可复现的结果。
- 开放了完整的框架、测试、基准智能体代码与评估方法,有利于社区复现和进一步研究。
局限与不确定性
- NOOA 目前为“研究预览”(research preview),可能尚未达到生产级健壮性。文章提及生产部署可与 NVIDIA OpenShell 安全运行时配合。
- 基准结果依赖于特定模型版本(GPT-5.5、GPT-5.6-sol、Opus 4.6),这些模型的具体能力与可用性待核实。
- CyberGym L1 评测中网络访问被阻止,且规则检查严格,实际应用场景可能更复杂。
- 长期记忆的反射过程可能引入额外计算开销,但文章未量化。
可用于图书/PPT/简报的角度
- “智能体性能不仅仅来自模型”:用 NOOA 的六项能力和基准数字说明夹具设计的决定性作用。
- “面向对象 = 智能体新范式”:将智能体写成 Python 类的极简设计如何简化开发并提升可维护性。
- “记忆即 SQLite”:智能体自主策划的类型化记忆系统与知识图谱的落地案例。
- “成本减半,效果更优”:传引用与无上下文压缩带来的 token 节省分析。
- 与已有脉络的关系:区别于此前专门为某一模型(如 Nemotron 3 Ultra)定制夹具配置文件的思路,NOOA 提供通用的、模型无关的框架,并在多个模型上验证了泛化能力。
原始材料
- 英文标题:Six Agent Harness Capabilities for Higher Model Performance
- 英文关键词:agent, harness, NOOA, NVIDIA Labs, object-oriented agents
- 原始来源 URL:https://developer.nvidia.com/blog/six-agent-harness-capabilities-for-higher-model-performance