知识卡片:Muon 遇见 Mamba:状态空间模型的谱优化
一句话结论
在 Mamba-2 130M 模型上的受控实验中,Muon 优化器的收益具有局部性:仅对输出投影使用 Muon 优于对输入投影或同时对两者使用;优势主要体现在 token 效率上,且条件数不能解释这一收益。
事件概述或研究问题
- 研究问题:Muon 是一种通过对每个权重矩阵的更新做正交化(Newton-Schulz 迭代)、在谱范数下执行最速下降的优化器,但既有证据几乎全部来自 Transformer 模型,其在状态空间模型(SSM)上的行为鲜有报告。
- 本文在 Mamba-2 130M 上对比 Muon 与 AdamW,采用控制变量协议:仅改变哪些权重组由 Muon 训练,其余设置保持一致。
方法/产品要点
- Muon 优化器:利用 Newton-Schulz 迭代对更新矩阵进行正交化,在谱范数意义下实现最速下降。
- 评估对象:Mamba-2 130M。
- 控制变量设计:比较“输出投影用 Muon”“输入投影用 Muon”“两者都用 Muon”等配置,其余权重仍用 AdamW。
- 评估维度:两个语料、两种 token 预算,并延长训练至超过计算最优点后观察持续性。
主要结果或产业意义
- Muon 仅用于输出投影时,效果优于仅用于输入投影或同时用于两者。
- 该优势主要表现为 token 效率提升,并在两种语料和两种 token 预算下均成立;训练持续到超过计算最优点后,优势仍然保持。
- 条件数不能解释收益:Muon 确实降低了它所训练投影的条件数,但条件数更好的输入投影并非带来收益的那个投影。
为什么重要
- 为谱优化器在状态空间模型上的应用提供了受控证据,说明 Muon 并非“处处有效”,其收益高度依赖应用位置。
- 与既有 Mamba 相关卡片关注内部状态测量、推理适配器、图像恢复不同,本卡片增量信息在于:Mamba-2 训练中 Muon 的最优使用位置是输出投影。
与既有脉络的关系
- 已有相关卡片覆盖了选择性状态空间模型的测量工具、适配器、高效图像恢复;本卡片补充了“优化器选择”这一训练层面的视角,并将 Muon 的适用范围从 Transformer 扩展到 SSM 的特定权重组。
局限与不确定性
- 具体性能提升数值、条件数下降幅度等定量细节待核实。
- 实验仅针对 Mamba-2 130M 规模,更大模型或其他 SSM 架构上的表现待核实。
- 由于未能抓取正文,超参数设置、Newton-Schulz 迭代次数、计算预算等实现细节待核实。
可用于图书/PPT/简报的角度
- “优化器不是通用的:Muon 在 Transformer 上表现好,但在 Mamba 上需要选对投影位置。”
- “更低的条件数不等于更好的训练收益——输入投影条件数更优却无益,输出投影才是关键。”
- 可制作对比表:AdamW vs Muon-on-output vs Muon-on-input vs Muon-on-both(具体数据待核实)。
原始材料
- 英文标题:Muon Meets Mamba: Spectral Optimization for State Space Models
- 英文关键词(基于摘要提取):Muon optimizer; state space models; Mamba-2; spectral norm; Newton-Schulz; token efficiency; AdamW
- URL: https://arxiv.org/abs/2608.03941v1
- Track: academic
- Topics: foundation-model