知识卡片:Muon何时有助于智能体强化学习?
一句话结论
Muon优化器在稀疏奖励的智能体强化学习后训练中,若配合合适的优势估计器和学习率,可大幅提升成功率(最高+88%),但其效果高度依赖超参数选择,且目前仅有单种子验证。
事件概述或研究问题
Muon优化器在大规模预训练中已被证明与AdamW竞争力相当,但其在强化学习(RL)后训练中的价值尚不明确。本研究针对稀疏奖励的智能体RL场景,通过ALFWorld环境(使用Qwen2.5-0.5B-Instruct模型)进行匹配的单种子对比实验,检验原始(vanilla)Muon相比于AdamW的效果。
方法/产品要点
- 框架:Group-in-Group Policy Optimization (GiGPO)
- 应用方式:仅对隐藏权重矩阵使用Muon,保持其余部分不变
- 基线:同等设置下的AdamW
- 变量:不同优势估计器(GRPO、GraphGPO)和不同学习率(1e-5、3e-5)
主要结果或产业意义
- 在GiGPO下,Muon将最终窗口验证成功率从0.290提升至0.546(+88%);而高学习率AdamW控制组在更新后成功率为0(未取得后续成功)。
- 学习率3e-5时,Muon将GRPO的成功率从0.161提升至0.268;GraphGPO的后期窗口差距在接近饱和时缩小。
- 学习率1e-5时,GraphGPO配合Muon达到0.901,归一化验证AUC从0.399提升至0.556,并分别提前30和60次更新达到0.5和0.75成功率。
这些结果表明Muon能显著加速智能体RL的收敛并提升最终性能,具有潜在的产业应用价值(如机器人操控、工具使用等需要快速学习的智能体场景)。
为什么重要
- 此前Muon的效果主要在大规模预训练中被研究,本研究首次系统检验其在RL后训练中的表现,拓展了Muon的应用边界。
- 揭示策略优化器、优势估计器和学习率之间存在联合依赖关系,为未来优化器选择提供了新的研究方向。
局限与不确定性
- 所有结果基于**单种子(single-seed)**实验,缺乏多种子重复验证,统计显著性和稳定性待确认。
- 仅测试了ALFWorld单一任务,跨任务泛化能力未知。
- Muon的最佳配置(优势估计器、学习率、应用层)尚未系统确定,效果对超参数敏感。
- 未比较其他结构化优化器(如SOAP),与已有卡片中的MUON/SOAP在MLIP中的应用场景不同,不可直接类比。
与既有脉络的关系
- 本卡片更新自“超越Adam:SOAP与Muon加速机器学习原子间势训练的标签高效优化器”(2026-07-02),但前者聚焦MLIP训练中标签高效场景,本卡片聚焦智能体强化学习后训练,且实验环境、模型、任务类型完全不同。
- 本卡片提供Muon在RL后训练中的首个定量证据,是对Muon应用场景的重要补充。
可用于图书/PPT/简报的角度
- 案例:优化器选择如何影响强化学习后训练效率?以Muon对稀疏奖励智能体的改进为例。
- 对比:AdamW vs. Muon在相同RL框架下的成功率曲线与收敛速度。
- 启示:超参数(学习率、优势估计器)与优化器需协同调整,不能孤立看待。
原始材料
- 英文标题:When Does Muon Help Agentic Reinforcement Learning?
- 英文关键词:Muon, AdamW, agentic reinforcement learning, sparse-reward, GiGPO, GRPO, GraphGPO, Qwen2.5-0.5B-Instruct, ALFWorld
- 来源:arXiv:2607.16169v1, https://arxiv.org/abs/2607.16169v1