AI消息速览

PAST-Bench:评测个人智能体递归自我改进的基础

事件日期 2026-08-04 · 学术前沿 · 已接受

事件日期2026-08-04
信息日期2026-08-04
入库日期2026-08-05
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:PAST-Bench:评测个人智能体递归自我改进的基础

一句话结论

PAST-Bench 通过“保留经验开/关”的对照实验,系统检验个人智能体能否从已积累的经验中获得后续任务改进;结果发现改进真实但不均衡,相同总增益下路径证据可能不同;基于此提出的 Hermes+ 能提高平均增益并给出更清晰的路径证据,但效果仍依赖能力与模型。

事件概述或研究问题

递归自我改进要求智能体将积累的经验转化为未来更好的行为。个人 AI 智能体为此提供了具体场景,因为它们在会话之间保留偏好、任务历史、工具例程和学到的技能。然而,保留的经验是否真的能改善后续行为,此前没有被系统测试。PAST-Bench 正是为了隔离并回答这一问题而设计。

方法/产品要点

  • 每个智能体在匹配条件下运行有序的新会话任务序列,通过“保留经验开/关”对比来测量改进是否来自经验。
  • 基准覆盖 26 个场景、204 个 episode,涉及记忆(memory)、程序复用(procedural reuse)、信息收集(information gathering)和更新(update)四类能力。
  • 不仅报告后续任务增益,还检验增益是否遵循预期的“保存—检索—更新”(save, retrieve, update)路径。
  • 在七个基础模型和四个智能体框架上进行了评估。
  • 基于诊断结果,作者开发 Hermes+,在智能体循环的多个阶段加入五项针对性干预。

主要结果或产业意义

  • 从保留经验中获得的改进是真实的,但在不同能力维度上表现不均衡。
  • 具有相同总体增益的智能体,其增益是否得到“预期路径证据”的支持可能差异显著——这提示仅看最终分数会掩盖机制上的差异。
  • Hermes+ 提高了从保留经验中获得的平均增益,并提供了更清晰的路径证据;其最强改进出现在需要替换过时状态的任务上,但效果仍依赖具体能力和模型。

为什么重要

该工作为“持久智能体如何从保留经验走向系统性改进”提供了评估与诊断基础。与既有相关卡片中“有界自我精炼 vs 开放式 RSI”的分类视角不同,PAST-Bench 聚焦个人智能体的经验保留回路,并把“路径证据”作为诊断维度,为后续研究提供了可量化的评测工具。

局限与不确定性

  • 本卡片仅基于元数据生成,未能获取全文;具体实验设置、基线选择、统计显著性和消融细节待核实。
  • Hermes+ 的效果依赖能力和模型,说明其干预并非普适性突破。
  • “最强改进”仅针对需要替换过时状态的任务类型,不能外推为全面超越。

可用于图书/PPT/简报的角度

  • 用“同一增益,不同路径”说明评测智能体不能只看最终指标,还要看改进是否来自合理的机制。
  • 用“保留经验 = 开/关”的对照设计,解释如何因果地测量记忆与经验的价值。
  • 以个人助理为例,说明真正的“越用越聪明”需要状态更新、流程复用和主动检索等环节协同。

英文标题与关键词

  • 英文标题:PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents
  • 英文关键词:Recursive Self-Improvement; Personal Agents; Benchmark; Experience Retention; Agent Evaluation

原始材料

  • URL: https://arxiv.org/abs/2608.04003v1
  • 来源:arXiv preprint(基于元数据摘要生成,正文待核实)