AI消息速览

用 NVIDIA NemoClaw 构建记忆驱动的智能体

事件日期 2026-09-04 · 产业观察 · 待审核

事件日期2026-09-04
信息日期2026-09-04
入库日期2026-09-05
通道产业观察
状态待审核
来源NVIDIA 博客

知识卡片:用 NVIDIA NemoClaw 构建记忆驱动的智能体

英文标题:Building a Memory-Driven Agent with NVIDIA NemoClaw 英文关键词:NemoClaw; memory-driven agent; self model; SQLite ledger; NVIDIA OpenShell; Agent Memory Benchmark; agentic RAG; structured memory; enterprise workflow; NVIDIA Nemotron 原始来源:NVIDIA Technical Blog — Xuan Wu, Alexia Huang, Yijie Lai, Joe Liu, Xiaowei Li(2026-09-04)。https://developer.nvidia.com/blog/building-a-memory-driven-agent-with-nvidia-nemoclaw

一句话结论

NVIDIA NemoClaw 示例实现了一个“记忆驱动 Chief of Staff 智能体”:用 Markdown 形式的 self model(自模型)保存人物、项目、优先级等工作知识,用 SQLite 账本保存判断与审计记录,并用 NVIDIA OpenShell 做运行时沙箱治理。该设计在 Agent Memory Benchmark 上将整体准确率从 agentic RAG 基线的 82.8% 提升到 90.9%,但也在个别检索指标上略有回落。

事件概述/研究问题

  • 企业工作流中充满消息、决策、项目和随时间变化的待办事项。如果一个 AI 智能体没有这些历史背景,就必须在真正产生贡献前先“重建上下文”。
  • 本文核心问题是:如何为智能体提供长期、可维护、可治理的记忆,而不是仅仅增加存储空间或聊天历史。
  • 作者基于 NVIDIA NemoClaw 构建了一个示例:记忆驱动型 Chief of Staff 智能体。其经验结论是,有用的智能体记忆需要结构、选择性检索和治理,而不只是“能存下来”。

方法/产品要点

1. Self model:结构化、人类可读的知识层

  • 智能体维护一个“自我模型(self model)”,记录与工作相关的人物、项目、优先级、目标、概念和重复出现的工作模式。
  • 这些知识以结构化 Markdown 页面保存,schema 包含索引、交叉引用、来源追溯和增长限制。
  • self model 保存的是“经过推导的解释”,不是替代原始证据;证据与知识分开,便于定位错误来自证据、记忆维护、检索还是模型最终判断。

2. 证据 → 知识 → 受控执行

  • 示例架构大致分为三层:证据(Evidence)→ 知识(Knowledge)→ 受治理执行(Governed execution)。
  • 每次任务先检索有限的相关上下文,再更新或使用 self model。
  • Markdown 记忆保存知识,SQLite 账本保存义务事项、排序、用户纠正和审计事件。
  • 这种设计避免把智能体的“判断”直接写回源消息或数据源中,例如不使用已读标记、标签或文件夹来表达判断。

3. 用户意图优先于短期紧迫性

  • 请求常常自称“紧急”,但紧急并不等于用户真正重视。
  • 示例中引入“意图门控(intent gate)”:与用户明确优先级相关的义务事项会排在最高等级;一个紧急的费用政策确认事项虽然仍可见,但排名低于一个与用户陈述优先级相关的更安静请求。
  • 智能体可以解释“优先级”关系,但层级大小、溢出行为和排序顺序由确定性代码强制保证。

4. 用户可纠正智能体判断,并形成可读偏好策略

  • 持久记忆可能固化错误判断。用户可以移动义务事项到其他等级,或忽略它,后续运行会保留这一纠正决定。
  • 每次修改被记录在 append-only(只追加)审计轨迹中。
  • 重复出现的纠正模式可以更新一份小型、可读的偏好策略文件;用户可查看、编辑或删除,而不是把偏好隐藏在大模型参数状态中。
  • 反馈环路为:智能体判断 → 用户纠正 → 审计事件 → 偏好更新。

5. 运行时边界:NVIDIA OpenShell

  • 示例使用 NVIDIA OpenShell 作为自主智能体的安全运行时,沙箱化运行并约束文件系统、进程和网络访问。
  • 受管推理和 MCP 连接的凭证保留在沙箱之外。
  • 关键原则是:记忆和检索内容只是模型输入,不是可信安全策略;即使智能体误解上下文或遭到恶意指令操纵,也只能在操作者定义的运行时边界内行动。

6. Recipe 内容

  • 该项目以一个可部署的 Hermes profile 形式打包,包括:
    • 结构化记忆 schema
    • 持久化义务账本
    • 有界的排序逻辑
    • 用户纠正与审计路径
    • 定时记忆维护
    • 合成消息和记忆页面
    • 离线 walkthrough
    • 单元测试

主要结果或产业意义

在相同配置下,使用 NVIDIA Nemotron 3 Ultra 的对比结果如下:

指标 问题数 Agentic RAG 基线 Self model 差异
Overall accuracy(整体准确率) 186 82.8% 90.9% +8.1 pp
Hard questions(难题) 31 67.7% 87.1% +19.4 pp
Tracking facts that changed over time(随时间变化的事实追踪) 5 60.0% 100.0% +40.0 pp
Point-in-time reasoning(时点推理) 6 33.3% 66.7% +33.3 pp
Entity disambiguation(实体消歧) 15 66.7% 86.7% +20.0 pp
Multisource synthesis(多来源综合) 73 87.7% 94.5% +6.8 pp
Answered faithfully based on Corpus(忠实基于语料库作答) 13 100.0% 92.3% -7.7 pp
Single-hop lookup(单跳查找) 30 86.7% 83.3% -3.3 pp
Citation coverage(引用覆盖) 186 92.5% 97.8% +5.4 pp

产业意义:

  • “上下文可以辅助行动,但不能授权行动”:记忆、检索和模型判断都不等于权限边界,这为企业智能体落地提供了安全治理思路。
  • 将事实证据、长期知识和运行判断分层存储,使智能体的错误更容易归因,也更适合需要审计的企业环境。
  • 让用户通过“纠正—审计—偏好策略”的方式参与记忆维护,有助于建立对持久记忆系统的信任。

为什么重要

  • 与已有卡片中偏向流程自动化、模型技能或算力加速的 NVIDIA 智能体方案相比,本条最重要的增量是“智能体长期记忆怎么做”的系统设计:
    • 不是简单加长上下文或做 RAG;
    • 而是把个人/团队工作记忆变成“知识 + 判断账本 + 治理边界”的三层结构。
  • 它同时展示了一种可落地的治理机制:自我模型与 SQLite 审计账本分离、OpenShell 沙箱、凭证外置、用户偏好可读可改。
  • 这种“可检查、可纠正、可治理”的记忆架构,是做企业级 AI 助手、AI Chief of Staff 或长期运行智能体时可以借鉴的设计模板。

与既有脉络的关系

  • 本条延续 NVIDIA Technical Blog 中关于智能体框架的系列文章,但焦点不是 NeMo 训练/RL 实验自动化,也不是 BioNeMo 科学计算管道,而是企业智能体的记忆架构与运行时治理。
  • 它与“NVIDIA NeMo”和“Nemotron”技术栈相关,但核心增量在于 self model、SQLite 判断账本、用户纠正回路和 OpenShell 安全边界。

局限与不确定性

  • 当前 recipe 是“记忆基础”演示,不发送消息、不修改源系统;真实连接邮件、日历、IM 或企业系统还需要单独处理凭证、隐私、留存和删除问题。
  • 示例中的人物、组织、项目和消息均为合成数据;离线 walkthrough 使用预录的模型决策代替真实推理,再由代码执行排序、纠正、持久化和验证行为。
  • Agent Memory Benchmark 中部分子集样本量很小,例如“随时间变化的事实追踪”只有 5 题、“时点推理”只有 6 题,相关提升幅度需结合样本规模理解。
  • 某些指标如“忠实基于语料库作答”和“单跳查找”在 self model 下有下降,说明记忆增强并非在所有任务上都优于 agentic RAG。
  • NVIDIA NemoClaw 与 OpenShell 的完整产品定义、正式许可证、生产部署要求和基准的详细评估口径,本文未展开;待核实。
  • 页面顶部由 AI 生成的摘要指出它可能不完整;本卡主要依据正文与表格,关键事实请以原文链接为准。

可用于图书/PPT/简报的角度

  • “智能体记忆不是一块连续文本,而是一种产品架构”:从存储到 schema、检索、治理、审计的完整设计。
  • “记忆驱动型 Agent 的五个设计教训”:跨日保持上下文、分离证据/知识/行动、优先级高于紧急度、允许用户纠正、用沙箱强制边界。
  • “上下文只能提示,不能授权”:用 OpenShell 做企业级智能体安全边界的可视化示例。
  • “从 RAG 到 self model”:回答企业场景中“为什么单纯 RAG 不够”的对比数据。

原始材料

  • 英文标题:Building a Memory-Driven Agent with NVIDIA NemoClaw
  • 原始来源:https://developer.nvidia.com/blog/building-a-memory-driven-agent-with-nvidia-nemoclaw
  • 作者:Xuan Wu, Alexia Huang, Yijie Lai, Joe Liu, Xiaowei Li
  • 发布信息:NVIDIA Technical Blog,2026-09-04
  • 原文标签:Agentic AI / Generative AI;Developer Tools & Techniques;General;NeMo;Nemotron;Intermediate Technical;Tutorial;AI Agent;Build AI Agents;LLMs;NemoClaw;OpenShell;Retrieval Augmented Generation (RAG)