知识卡片:智能体优化器的增益能否持续累积?——基于 Terminal-Bench 2.0 的持续学习评估
一句话结论
在持续学习场景下,只有内置回归控制(regression control)的智能体优化方法才能使优化增益在新任务上持续累积;否则,要么负迁移,要么无法在新一轮优化中继续提升。
事件概述或研究问题
目前大多数智能体优化方法的报告收益是一次性的(one-shot):智能体针对固定基准优化后,改进结果被当作方法的稳定属性。这并未测试部署型智能体面临的真实场景——随着时间推移,新失败和新任务出现,优化会被递归应用。核心问题是:优化器驱动的增益能否复合(compound)?即,智能体在第一轮优化后,是否能在新任务上再次优化而不侵蚀第一轮获得的增益?
方法/产品要点
- 使用 Terminal-Bench 2.0 的困难任务构建两阶段持续学习评估。
- 在相同的优化预算下比较三种智能体“驾驭(harness)”优化方法:
- GEPA(基于进化的策略优化?具体名称待核实)
- Meta Harness(元学习驾驭)
- RELAI-VCL(RELAI 的可验证持续学习,RELAI's Verifiable Continual Learning)
- 实验设计:第一阶段优化 → 引入新任务 → 第二阶段再优化,观察各方法的通过率和迁移效果。
主要结果或产业意义
- 在传统静态单阶段设定中,所有三种方法都优于基线智能体。
- 引入新任务后,方法表现急剧分化:
- GEPA:优化后的智能体在新任务上迁移效果低于未优化的基线(负迁移)。
- Meta Harness:正向迁移良好,但获得第二轮优化预算后无法进一步提升。
- RELAI-VCL:是唯一既能正向迁移到未见任务,又能将新任务纳入优化目标后继续提升的方法。它在每个评估阶段的通过率均为最高,总体终身平均通过率达 76.4%,远超 GEPA(66.0%)、Meta Harness(64.6%)和基线(58.7%)。
- 关键发现:只有将回归控制(regression control)内置到优化循环中,优化增益才能复合;这为对抗无法泛化的“捷径解”提供了归纳偏置。
为什么重要
- 揭示了现有智能体优化评估范式的根本缺陷:一次性基准测试高估了方法的实际部署价值。
- 提出了“优化增益复合性”这一新评估维度,为智能体终身学习的优化器设计提供了方向性证据。
- 与既有知识卡片(如 GaP 多智能体框架、VLA 忠实性等)不同,本文聚焦于优化器本身的递归应用能力,而非特定任务或架构。
局限与不确定性
- 实验仅基于 Terminal-Bench 2.0 的困难任务,泛化性需在其他基准上验证。
- 三种方法的内部机制细节(如 GEPA 的具体算法)因材料有限无法确认。
- 回归控制的具体实现方式(如正则化强度、记忆重放形式)未在摘要中展开,需查阅全文。
可用于图书/PPT/简报的角度
- 主题:“智能体优化的生命周期”——从一次性改进到持续复合的范式转变。
- 数据:RELAI-VCL 的 76.4% vs 基线 58.7%,直观展示复合优化带来的绝对优势。
- 比喻:就像健身训练——只练一次肌肉会萎缩(负迁移),按固定计划重复会瓶颈(Meta Harness),而动态调整负荷并防止旧能力衰退(回归控制)才能持续进步。
原始材料
- 标题:Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0
- arXiv ID:2607.14004v1
- 作者:Wenxiao Wang, Priyatham Kattakinda, Soheil Feizi
- 来源:https://arxiv.org/abs/2607.14004v1
Keywords
Agent Optimization, Continual Learning, Terminal-Bench 2.0, GEPA, Meta Harness, RELAI-VCL, Regression Control