AI消息速览

Muon何时有助于智能体强化学习?

事件日期 2026-07-02 · 学术前沿 · 已接受

事件日期2026-07-02
信息日期2026-07-17
入库日期2026-07-21
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:Muon何时有助于智能体强化学习?

一句话结论

Muon优化器在稀疏奖励的智能体强化学习后训练中,若配合合适的优势估计器和学习率,可大幅提升成功率(最高+88%),但其效果高度依赖超参数选择,且目前仅有单种子验证。

事件概述或研究问题

Muon优化器在大规模预训练中已被证明与AdamW竞争力相当,但其在强化学习(RL)后训练中的价值尚不明确。本研究针对稀疏奖励的智能体RL场景,通过ALFWorld环境(使用Qwen2.5-0.5B-Instruct模型)进行匹配的单种子对比实验,检验原始(vanilla)Muon相比于AdamW的效果。

方法/产品要点

  • 框架:Group-in-Group Policy Optimization (GiGPO)
  • 应用方式:仅对隐藏权重矩阵使用Muon,保持其余部分不变
  • 基线:同等设置下的AdamW
  • 变量:不同优势估计器(GRPO、GraphGPO)和不同学习率(1e-5、3e-5)

主要结果或产业意义

  • 在GiGPO下,Muon将最终窗口验证成功率从0.290提升至0.546(+88%);而高学习率AdamW控制组在更新后成功率为0(未取得后续成功)。
  • 学习率3e-5时,Muon将GRPO的成功率从0.161提升至0.268;GraphGPO的后期窗口差距在接近饱和时缩小。
  • 学习率1e-5时,GraphGPO配合Muon达到0.901,归一化验证AUC从0.399提升至0.556,并分别提前30和60次更新达到0.5和0.75成功率。

这些结果表明Muon能显著加速智能体RL的收敛并提升最终性能,具有潜在的产业应用价值(如机器人操控、工具使用等需要快速学习的智能体场景)。

为什么重要

  • 此前Muon的效果主要在大规模预训练中被研究,本研究首次系统检验其在RL后训练中的表现,拓展了Muon的应用边界。
  • 揭示策略优化器、优势估计器和学习率之间存在联合依赖关系,为未来优化器选择提供了新的研究方向。

局限与不确定性

  • 所有结果基于**单种子(single-seed)**实验,缺乏多种子重复验证,统计显著性和稳定性待确认。
  • 仅测试了ALFWorld单一任务,跨任务泛化能力未知。
  • Muon的最佳配置(优势估计器、学习率、应用层)尚未系统确定,效果对超参数敏感。
  • 未比较其他结构化优化器(如SOAP),与已有卡片中的MUON/SOAP在MLIP中的应用场景不同,不可直接类比。

与既有脉络的关系

  • 本卡片更新自“超越Adam:SOAP与Muon加速机器学习原子间势训练的标签高效优化器”(2026-07-02),但前者聚焦MLIP训练中标签高效场景,本卡片聚焦智能体强化学习后训练,且实验环境、模型、任务类型完全不同。
  • 本卡片提供Muon在RL后训练中的首个定量证据,是对Muon应用场景的重要补充。

可用于图书/PPT/简报的角度

  • 案例:优化器选择如何影响强化学习后训练效率?以Muon对稀疏奖励智能体的改进为例。
  • 对比:AdamW vs. Muon在相同RL框架下的成功率曲线与收敛速度。
  • 启示:超参数(学习率、优势估计器)与优化器需协同调整,不能孤立看待。

原始材料

  • 英文标题:When Does Muon Help Agentic Reinforcement Learning?
  • 英文关键词:Muon, AdamW, agentic reinforcement learning, sparse-reward, GiGPO, GRPO, GraphGPO, Qwen2.5-0.5B-Instruct, ALFWorld
  • 来源:arXiv:2607.16169v1, https://arxiv.org/abs/2607.16169v1