知识卡片:OpenForgeRL:用于训练框架原生智能体的开源强化学习框架
English Title: OpenForgeRL: Train Harness-native Agents in Any Environment
Keywords: Harness, Reinforcement Learning, Tool Use, GUI Agent, Open-source Framework, Agent Training
一句话结论
OpenForgeRL 是一个开源框架,通过轻量级代理和 Kubernetes 编排器解耦训练与推理,使得研究者能够直接在实际部署的 AI 代理推理框架 (Harness) 中,使用标准强化学习 (RL) 代码库对智能体进行端到端训练,并在多项工具使用和 GUI 操作基准上以较少任务量超越了同等规模的开放基线模型。
事件概述
现代 AI 代理(如 Claude Code、Codex、OpenClaw)依赖复杂的推理框架来进行多轮推理、工具调用和系统访问。然而,这些框架的复杂性和有状态、多进程特性,使得它们难以与标准的开源 SFT/RL 训练栈(如 veRL)兼容。现有基础设施无法原生表达这种框架形式下的推理过程。为了解决这一痛点,论文提出了 OpenForgeRL,这是一个用于在各种环境中对基于框架的智能体进行端到端训练的开源框架。
方法/产品要点
- 轻量级代理 (Lightweight Proxy):该代理负责处理 Harness 的模型调用请求,在提供服务的同时,将这些调用记录为训练数据,并发送给标准 RL 代码库(如 veRL)。这实现了训练与推理的解耦。
- Kubernetes 编排器 (Kubernetes Orchestrator):该编排器将每次模型交互的展开(rollout)运行在独立的远程容器中。这使得框架能够在任何 Harness 和任何环境中进行大规模训练。
- 框架无关性:通过上述设计,OpenForgeRL 可以兼容各种不同的 Harness(如 ZeroClaw, OpenClaw, Codex)和环境(如浏览器、桌面操作系统)。
主要结果或产业意义
论文在两类智能体上验证了框架的有效性:
- 工具/爪型智能体 (Tool/Claw-based Agents):
- OpenForgeClaw 在 ClawEval 上达到 31.7 pass^3 和 55.9 pass@3。
- 在 QwenClawBench 上达到 33.7。
- 多模态 GUI 智能体 (Multimodal GUI Agents):
- OpenForgeGUI 在 OSWorld-Verified 上达到 37.7。
- 在 Online-Mind2Web 上达到 63.0。
- 在 WebVoyager 上达到 72.3。
- 性能对比:两者在几乎所有基准测试中都优于同等大小的开放基线模型,在 GUI 设置中甚至匹配或超越了数倍于其大小的模型。这些成果仅基于数百到数千个任务训练得出。
为什么重要
此项工作解决了当前开源 AI 代理训练中的一个关键障碍:无法在端到端的训练流程中融入先进但复杂的推理框架。OpenForgeRL 提供了一个通用、可扩展的解决方案,使得研究者可以不在标准 RL 框架和专有推理框架之间做取舍,从而能够直接研究、训练和改进最终部署时会使用的智能体。其结果表明,通过 RL 可以显著提升智能体的可靠性,如自我验证、工具覆盖范围和多步骤计划的完成能力。
局限与不确定性
- 错误恢复能力依然薄弱:论文指出,尽管 RL 提升了可靠性,但关键能力如“错误恢复”仍然较弱。
- 不同 Harness 的学习难度差异:研究发现一些 Harness 比其他 Harness 难学得多,原因待进一步分析。
- 适用性边界:框架的实际效果高度依赖于 Harness 和环境的特定设计,通用性虽强但具体性能表现可能存在差异。
- 范围待核实:论文声称适用于“任何 Harness”和“任何环境”,但其验证的 Harness 和环境种类有限,具体通用性边界需由后续工作确认。
可用于图书/PPT/简报的角度
- 技术突破:作为一个技术解决方案,展示了如何通过架构创新(代理 + 编排器)来打破传统训练流程的限制。
- RL 在 Agent 中的应用案例:具体说明了 RL 如何影响智能体行为(如提升自我验证能力),以及为什么 RL 比单纯 SFT 更适合训练复杂的代理。
- 开源 VS 闭源:展示了开源方案在特定任务上可以“以小博大”,用更小的模型和更少的任务量匹配甚至超越更大的模型。
- 两句话类比:就像汽车发动机(训练算法)需要匹配变速箱(推理框架)才能发挥最佳性能,OpenForgeRL 相当于一套能够适配各种 “变速箱” 的 “通用离合器”,让强大的“发动机”也能被装进不同的“车”里。
与既有脉络的关系
本卡片侧重介绍一个用于训练现有 AI 代理的新工具和新方法论。与 “多智能体辩论” 和 “SolarChain-Eval” 等卡片关注的具体现象或场景不同,OpenForgeRL 关注的是底层训练基础设施的升级。
原始材料
- URL: https://arxiv.org/abs/2607.21557v1
- arXiv ID: 2607.21557v1
- 作者: Xiao Yu, Baolin Peng, Ruize Xu, Hao Zou, Qianhui Wu, Hao Cheng, Wenlin Yao, Nikhil Singh, Zhou Yu, Jianfeng Gao
- 发表时间: 2026年7月23日
- 类别: cs.AI, cs.CL