知识卡片:面向终端智能体的环境演化方法
英文标题:Environment Evolution for Terminal Agents
英文关键词:Environment Evolution; Terminal Agents; Co-evolution; Off-policy; Long-horizon RL; Terminal-Bench 2.1
一句话结论
论文提出“环境演化”(Environment Evolution)方法,在训练终端智能体时通过“off-policy”(离线/非当前策略)方式逐步提高任务环境难度,并按代调度演化后的环境,以持续提供有效学习信号;在 Terminal-Bench 2.1 上,经简单长程 RL 训练,Qwen3.6-27B 和 Qwen3.6-35B-A3B 的性能分别提升 14.4 和 18.0 个百分点。
事件概述或研究问题
可交互、可验证的环境规模对训练终端智能体(terminal agents,如终端/命令行操作智能体)至关重要。但随着前沿模型能力增强,从零合成的新环境越来越不具备挑战性,能够提供的学习信号有限。现有“共同演化”(co-evolution)方法虽然能根据 rollout 中暴露的弱点迭代合成环境,但依赖当前策略的 on-policy rollouts,会在模型变强后限制泛化能力和学习信号的持续供给。为此,论文提出环境演化方法。
方法/产品要点
- 核心机制:以 off-policy 方式逐步增加环境难度,并在训练中逐代(generation by generation)调度演化后的环境。
- 演化方向:从多轮学习目标中推导出三个影响环境难度的演化方向(具体方向与推导细节待核实)。
- 实现方式:通过一个循环工程化的多智能体 harness(loop-engineered multi-agent harness)沿上述方向实现环境演化(框架结构与各智能体角色待核实)。
- 与 co-evolution 的差异:co-evolution 主要基于当前策略 rollout 暴露弱点,逼近模型可学习边界;本方法强调 off-policy 难度递增和代际调度,以持续提供学习信号。
主要结果或产业意义
- 论文报告,使用 Hy4 preview、Claude Opus 5 和 GPT-5.6 Sol 进行的定量 rollout 实验显示,环境演化能够一致地产生更难的环境。
- 在 Qwen3.6-27B 与 Qwen3.6-35B-A3B 上,通过简单的长程 RL 训练,Terminal-Bench 2.1 性能分别提升 14.4 和 18.0 个百分点。
- 该结果意味着环境演化可以作为一种“环境侧”的训练信号供给策略,帮助终端智能体在模型能力持续增强后仍获得有难度的可验证训练任务。
为什么重要
- 该工作将注意力从“模型侧”扩展到“环境侧”:前沿模型越来越强时,训练环境难度的可持续供给成为瓶颈。
- 它提出环境不必只依赖当前策略的 rollout 来发现弱点,而是可以按难度方向离线演化并参与训练调度。
- 与本知识库已有脉络的增量关系:SHE 演化安全护栏,CompactionRL 处理长程历史上下文压缩,本文聚焦“任务环境本身的难度演化”,三者对应智能体训练管线中不同环节的可扩展机制。
局限与不确定性
- 摘要未给出三个演化方向的具体名称、形式或设计动机(待核实)。
- “loop-engineered multi-agent harness”的具体构成、生成/验证流程和计算开销不明确(待核实)。
- 论文面向 Terminal Agents 与 Terminal-Bench,但方法是否能推广到其他非终端任务尚不清楚(待核实)。
- 摘要未说明与哪些基线对比、训练设置细节、评测口径以及多次实验的波动情况(待核实)。
- 未提供消融实验、难度控制有效性分析或环境多样性等细节(待核实)。
可用于图书/PPT/简报的角度
- 以“当 AI 强到普通任务一看就会,训练难题从哪里来?”切入,讨论“环境侧演化”的新思路。
- 讲述从“共同演化(co-evolution)”到“环境演化(environment evolution)”的技术演进。
- 用 Terminal-Bench 2.1 上的两位数百分点提升作为案例,说明新的训练环境生成策略的有效性。
- 将已有卡片串联为“智能体训练方法图谱”:SHE 负责安全护栏演化、CompactionRL 负责长程上下文压缩、本文负责任务环境演化。
与既有脉络的关系
- 本文是继 SHE、CompactionRL 之后又一种“让训练过程随模型能力同步升级”的机制,但作用点在环境侧。
- SHE 聚焦护栏,CompactionRL 聚焦上下文,本文聚焦任务难度供给;三者描述的是智能体训练管线中不同但可互补的维度。
原始材料
- 英文标题:Environment Evolution for Terminal Agents
- arXiv ID:2609.04128v1
- 主要类别:cs.AI
- 作者:Zhiyuan Fan, Tinghao Yu, Yuanjun Cai, Jiang Zhou, Jiangtao Guan, Jincheng Liu, Yun Yang, Dingxin Hu, Zhuo Han, Xing Wu, Feng Zhang, Lilin Wang
- 发布时间:2026-09-03T17:26:33Z
- 英文摘要原文:
Scaling interactive and verifiable environments is critical for training terminal agents. As frontier models become more capable, environments synthesized from scratch become less challenging and thus provide limited learning signals. Recent co-evolution methods iteratively synthesize environments near the model's learnable frontier based on weaknesses exposed during rollouts. However, their dependence on on-policy rollouts limits generalization and the continuous provision of learning signals as the model becomes stronger. In this paper, we propose environment evolution, which incrementally increases environment difficulty off-policy and schedules the evolved environments generation by generation during training to provide continuous learning signals. We derive three evolution directions that influence environment difficulty from the multi-turn learning objective and then implement evolution along these directions through a loop-engineered multi-agent harness. Quantitative rollout experiments with Hy4 preview, Claude Opus 5, and GPT-5.6 Sol show that environment evolution consistently produces more difficult environments. We validate its effectiveness on Qwen3.6-27B and Qwen3.6-35B-A3B through simple long-horizon RL training, improving their performance by 14.4 and 18.0 percentage points on Terminal-Bench 2.1, respectively.
- 原始链接:https://arxiv.org/abs/2609.04128v1