知识卡片:NVIDIA AVO 达到 ARC-AGI-3 100%:面向长时程自主智能体的通用架构
一句话结论
NVIDIA 提出的 Agentic Variation Operators(AVO)智能体架构,将 Claude Opus 5 从约 30% 的模型基线提升到 ARC-AGI-3 公开集 100.00 RHAE 分数,表明在长时程自主任务中,智能体系统(harness)设计而非模型能力单独决定最终性能。
事件概述或研究问题
前沿语言模型只是 AI 智能体的一个组件。智能体如何接收上下文、使用工具、维护状态、响应反馈、从失败中恢复并维持长程进度,由外围的智能体系统(harness)决定。NVIDIA 研究项目 AVO 旨在构建一种通用智能体架构,使其能在长时间、多步骤任务中可靠运行。
AVO 首先在软件工程与 GPU kernel 优化任务上验证,随后被迁移到 ARC-AGI-3 交互推理基准,以检验该架构是否具有超越代码工程的通用性。
方法/产品要点
- AVO 核心架构:主智能体迭代执行“检查上下文→计划→实现变更→评估结果”,并配有持久记忆(persistent memory)和监督器(supervisor)。持久记忆保留实现、评估结果、编译/剖析输出和累积推理;监督器监测整体搜索轨迹,在进展停滞时介入并重定向策略。
- GPU-kernel 优化中的 AVO:取代传统进化搜索中预定义的变异步骤,由自主智能体决定检查什么、修改什么、测试什么、提交什么。
- ARC-AGI-3 中的 AVO:复用同一底层智能体,仅更换任务接口和环境工具。采用直接交互设计,参考 VISTA 的思路,但重新独立实现了任务接口;不构建显式程序化世界模型。
- 观察模态:在 AVO 的 ARC-AGI-3 配置中,语言模型仅使用文本模态——每个观察以 64×64 的精确文本网格提供,不向模型发送图像或图像 token;智能体只获得可用动作,不获得规则或目标描述。
主要结果或产业意义
- ARC-AGI-3 公开集:AVO 使用 Claude Opus 5,在全部 25 个环境中获得 100.00 RHAE 分数,完成全部 183 个关卡,共使用 6,624 个环境动作。
- 与 VISTA 对比:VISTA 使用 Claude Opus 5 完成同样 183 个公开集关卡需 7,542 个环境动作,AVO 约少用 12% 的动作。该对比不是受控消融实验。
- GPU-kernel 优化:AVO 在 NVIDIA DGX B200 系统上连续运行 7 天,探索 500 多个优化方向,提交 40 个 kernel 版本;多头注意力 kernel 相比 cuDNN 最高提升 3.5%,相比 FlashAttention-4 最高提升 10.5%。随后 AVO 约用 30 分钟自主工作将 kernel 适配到 grouped-query attention。
- 跨模型适应性:AVO 也搭配 GPT-5.6 Sol 在有挑战性的子集上做了有限实验,结果显示两者在不同维度各有优势,系统性对比留待未来工作。
为什么重要
- 该结果直观地说明:模型能力本身不等于智能体能力。ARC Prize 单独报告 Claude Opus 5 在 High reasoning effort 下约为 30%,而 AVO 系统在同一模型家族、不同推理设置和不同智能体系统下达到 100.00 RHAE,因此模型层面评估无法刻画完整智能体的性能。
- AVO 展示了“从代码工程到通用推理”的迁移:GPU-kernel 优化和 ARC-AGI-3 表面差异大,但核心计算模式相同——从部分证据构建假设、通过外部接口行动、观察结果、保存有用状态、修正错误假设、长期推进。
- 与既有相关卡片的增量信息:本条不聚焦于某个具体模型或夹具,而是提出一个通用的智能体系统架构,强调系统级设计(持久记忆、监督、工具使用)是解锁前沿模型长程自主能力的关键。
局限与不确定性
- 与 VISTA 的对比不是受控消融:两个系统在智能体后端、观察表示、记忆、上下文管理和其他实现细节上均有差异,12% 的动作差异不能单独归因于某一个机制。
- AVO 的记忆系统被推测可能有利于减少重复探索,但该实验并未隔离验证其单独贡献。
- ARC Prize 报告的 30% 与 AVO 实验所用的推理设置、智能体系统和评估设置不同,因此不能将 100.00 RHAE 直接解读为 AVO 相对于模型基线的净增益。
- 与 GPT-5.6 Sol 的配对实验规模有限,结论仍属初步。
- 当前结果基于 ARC-AGI-3 公开集;未提及私有集或官方整体排名情况。
可用于图书/PPT/简报的角度
- 用“模型是发动机,系统是底盘”的比喻说明智能体性能的来源。
- 长时程自主智能体需要哪四个关键机制:持久记忆、监督干预、工具使用、迭代执行。
- 从 GPU kernel 优化到 ARC-AGI-3 的跨域迁移,可作为“通用智能体架构”案例。
- 对比模型级评估与智能体级评估的差异,解释为何“模型跑分高”不等于“智能体能干活”。
原始材料
- 英文标题:NVIDIA AVO Reaches 100% on ARC-AGI-3, Demonstrating a Frontier-Level General-Purpose Architecture for Long-Horizon Autonomous Agents
- 英文关键词:Agentic AI, Long-Horizon Autonomous Agents, Agent Architecture, ARC-AGI-3, GPU-Kernel Optimization, Persistent Memory, Supervisor
- 来源:NVIDIA Technical Blog
URL: https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents