AI消息速览

Muon 遇见 Mamba:状态空间模型的谱优化

事件日期 2026-08-04 · 学术前沿 · 已接受

事件日期2026-08-04
信息日期2026-08-04
入库日期2026-08-06
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:Muon 遇见 Mamba:状态空间模型的谱优化

一句话结论

在 Mamba-2 130M 模型上的受控实验中,Muon 优化器的收益具有局部性:仅对输出投影使用 Muon 优于对输入投影或同时对两者使用;优势主要体现在 token 效率上,且条件数不能解释这一收益。

事件概述或研究问题

  • 研究问题:Muon 是一种通过对每个权重矩阵的更新做正交化(Newton-Schulz 迭代)、在谱范数下执行最速下降的优化器,但既有证据几乎全部来自 Transformer 模型,其在状态空间模型(SSM)上的行为鲜有报告。
  • 本文在 Mamba-2 130M 上对比 Muon 与 AdamW,采用控制变量协议:仅改变哪些权重组由 Muon 训练,其余设置保持一致。

方法/产品要点

  • Muon 优化器:利用 Newton-Schulz 迭代对更新矩阵进行正交化,在谱范数意义下实现最速下降。
  • 评估对象:Mamba-2 130M。
  • 控制变量设计:比较“输出投影用 Muon”“输入投影用 Muon”“两者都用 Muon”等配置,其余权重仍用 AdamW。
  • 评估维度:两个语料、两种 token 预算,并延长训练至超过计算最优点后观察持续性。

主要结果或产业意义

  • Muon 仅用于输出投影时,效果优于仅用于输入投影或同时用于两者。
  • 该优势主要表现为 token 效率提升,并在两种语料和两种 token 预算下均成立;训练持续到超过计算最优点后,优势仍然保持。
  • 条件数不能解释收益:Muon 确实降低了它所训练投影的条件数,但条件数更好的输入投影并非带来收益的那个投影。

为什么重要

  • 为谱优化器在状态空间模型上的应用提供了受控证据,说明 Muon 并非“处处有效”,其收益高度依赖应用位置。
  • 与既有 Mamba 相关卡片关注内部状态测量、推理适配器、图像恢复不同,本卡片增量信息在于:Mamba-2 训练中 Muon 的最优使用位置是输出投影。

与既有脉络的关系

  • 已有相关卡片覆盖了选择性状态空间模型的测量工具、适配器、高效图像恢复;本卡片补充了“优化器选择”这一训练层面的视角,并将 Muon 的适用范围从 Transformer 扩展到 SSM 的特定权重组。

局限与不确定性

  • 具体性能提升数值、条件数下降幅度等定量细节待核实。
  • 实验仅针对 Mamba-2 130M 规模,更大模型或其他 SSM 架构上的表现待核实。
  • 由于未能抓取正文,超参数设置、Newton-Schulz 迭代次数、计算预算等实现细节待核实。

可用于图书/PPT/简报的角度

  • “优化器不是通用的:Muon 在 Transformer 上表现好,但在 Mamba 上需要选对投影位置。”
  • “更低的条件数不等于更好的训练收益——输入投影条件数更优却无益,输出投影才是关键。”
  • 可制作对比表:AdamW vs Muon-on-output vs Muon-on-input vs Muon-on-both(具体数据待核实)。

原始材料

  • 英文标题:Muon Meets Mamba: Spectral Optimization for State Space Models
  • 英文关键词(基于摘要提取):Muon optimizer; state space models; Mamba-2; spectral norm; Newton-Schulz; token efficiency; AdamW
  • URL: https://arxiv.org/abs/2608.03941v1
  • Track: academic
  • Topics: foundation-model