AI消息速览

CompactionRL:基于上下文压缩的强化学习用于长程智能体

事件日期 2026-07-06 · 学术前沿 · 已接受

事件日期2026-07-06
信息日期2026-07-06
入库日期2026-07-07
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:CompactionRL:基于上下文压缩的强化学习用于长程智能体

英文标题

CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents

英文关键词

CompactionRL, reinforcement learning, context compaction, long-horizon agents, LLM agents

一句话结论

CompactionRL是一种将上下文压缩融入强化学习的训练策略,能够使长程智能体LLM从压缩后的历史轨迹中学习,在编码任务上显著提升Pass@1指标,并已部署到GLM-5.2模型的训练管线中。

事件概述或研究问题

长程智能体LLM在执行任务时,交互轨迹可能超出固定上下文窗口的长度,导致任务无法完成。上下文压缩通过总结之前的交互状态并在压缩后的上下文中继续生成,是一种自然的解决方案。然而,如何将上下文压缩有效整合到强化学习训练中,此前尚未被充分探索。本文提出CompactionRL,旨在解决这一空白。

方法/产品要点

  • 联合优化:同时优化任务执行(主任务)和摘要生成(压缩过程)。
  • 技术组件的缺失:使用token级损失归一化(token-level loss normalization)和跨轨迹广义优势估计(cross-trajectory generalized advantage estimation)。
  • 训练对象:在开源LLM基础上进行强化学习训练,使模型能够从压缩后的长程轨迹中学习。

主要结果或产业意义

  • 在SWE-bench Verified和Terminal-Bench 2.0两个基准上,CompactionRL在开源模型上取得一致提升:
    • GLM-4.5-Air (106B-A30B):Pass@1分别达到66.8%和24.5%,绝对提升7.0和3.1个百分点。
    • GLM-4.7-Flash (30B-A3B):Pass@1分别达到56.0%和20.2%,绝对提升5.5和6.8个百分点。
  • CompactionRL已被部署到开源GLM-5.2模型(750B-A40B)的强化学习管线中。

为什么重要

上下文窗口限制是当前LLM智能体用于长期自主任务的核心瓶颈之一。CompactionRL首次在强化学习框架内系统性地引入上下文压缩,使得模型能够处理更长的交互历史,同时保持训练效率。该方法开源并直接提升了GLM系列模型在编码任务上的竞争力。

局限与不确定性

待核实:原文未明确讨论模型的局限性或潜在风险,如压缩过程中信息丢失对下游任务的影响、计算开销、以及在不同类型任务(非编码)上的泛化能力等。

可用于图书/PPT/简报的角度

  • 介绍LLM智能体在处理长程任务时面临的上下文窗口挑战,以及上下文压缩作为解决方案的思路。
  • 对比传统强化学习训练与CompactionRL的差异,突出“压缩+强化学习”联合优化的创新点。
  • 以GLM系列模型为案例,展示开源模型在编码基准上的性能跃升,作为“小模型+高效训练”的范例。

原始材料

  • arXiv ID:2607.05378v1
  • 论文标题:CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents
  • 作者:Yujiang Li, Zhenyu Hou, Yi Jing, Jie Tang, Yuxiao Dong
  • 发布日期:2026-07-06
  • 主要类别:cs.LG
  • 论文摘要URL:https://arxiv.org/abs/2607.05378v1
  • PDF URL:https://arxiv.org/pdf/2607.05378v1