AI消息速览

Muon 的符号压缩:SignMuon、MuonSign 与误差反馈的边界

事件日期 2026-07-31 · 学术前沿 · 已接受

事件日期2026-07-31
信息日期2026-07-31
入库日期2026-08-03
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:Muon 的符号压缩:SignMuon、MuonSign 与误差反馈的边界

英文标题:Sign compression for Muon: SignMuon, MuonSign, and the Limits of Error Feedback

英文关键词:SignMuon; MuonSign; MuonUSign; Error feedback; Sign compression; Matrix-aware optimizer; Nonconvex optimization; Communication-efficient training

一句话结论

SignMuon 将 Muon 更新逐元素取符号,压缩到每参数 1 bit,是在极低通信预算下运行矩阵感知优化器的一种最直接方式;它在实践中优于 SignSGD,但即使在线性函数上也可能上升。把符号放在 LMO 之前或两侧并不能普遍修复该问题;误差反馈只有作用在梯度上时才带来标准非凸收敛率。更反直觉的是,实验中理论上会发散的 sign-after-LMO 压缩方式反而最强。

事件概述或研究问题

论文研究 Muon(一种矩阵感知优化器)在低比特通信约束下的符号压缩。核心问题包括:

  • 将 Muon 更新压缩为 1 bit(SignMuon)是否仍能保证下降?
  • 符号应该加在 Linear Minimization Oracle(LMO)之前、之后,还是两侧?
  • Error feedback(误差反馈)能否修复有偏压缩器带来的发散?
  • 理论上可证明的收敛性与实际深度学习任务中的表现是否一致?

方法/产品要点

  • SignMuon:对 Muon 更新取逐元素符号,每参数 1 bit。这是最直接的 1-bit 压缩方式。
  • MuonUSign:论文中的 sign-before 变体,即在 LMO 之前对梯度取符号。精确公式待核实。
  • MuonSign:论文中的 sign-on-both-sides 变体,即在 LMO 前后都取符号。精确公式待核实。
  • EF21-MuonUSign / EF21-MuonSign:将误差反馈(EF21)作用于梯度,而不是作用于 Muon 输出的两个变体。

主要结果或产业意义

理论结果

  • SignMuon 在实践中优于 SignSGD,但存在线性函数上目标上升的反例。
  • 作者构造了一个小型显式实例,MuonUSign(sign-before)和 MuonSign(sign-on-both-sides)也会上升;因此没有一种符号放置方式能在一般情况下保证下降。
  • 对 Muon 输出施加误差反馈:可以在任意光滑常数、步长和动量下失败。
  • 对梯度施加误差反馈:EF21-MuonUSign 和 EF21-MuonSign 在光滑非凸问题上达到标准 $\mathcal{O}(T^{-1/2})$ 的平方梯度范数速率;其中 EF21-MuonSign 以每个方向 1 bit 实现该速率。

实验与实践结果

  • 在 centralized CIFAR-10、federated CIFAR-10 和 nanoGPT speedrun 上,最强的压缩方法始终是 sign-after-LMO,即论文证明会发散的那一侧。
  • 可证明收敛的变体在实际表现上落后于该启发式。论文对此的表述是:在这些规模上,LMO 之后的压缩(一个启发式)比理论保证更重要。

为什么重要

  • 这是对 Muon/SOAP 优化器研究脉络的通信压缩补充:已有相关卡片关注 Muon/SOAP 在训练精度和收敛速度上的收益;本条补充的是低比特通信下的收敛性边界与误差反馈的适用位置。
  • 它说明误差反馈并非天然有效:同样是有偏压缩,作用在 Muon 输出上可能失败,作用在梯度上却可得到标准收敛率。
  • 它提供了一个理论保证与实践表现明显错位的案例:被证明发散的压缩方式在多个实际任务中仍是最强方法。

与既有脉络的关系

已有卡片记录了 SOAP/Muon 类优化器在机器学习原子间势训练上的优势;本卡片聚焦同一类优化器在通信压缩场景下的表现,不重复 MLIP 的精度结论,而是讨论“如果要把 Muon 更新压缩到 1 bit,误差反馈还能不能提供理论保证”。

局限与不确定性

  • SignMuon、MuonUSign、MuonSign 的完整公式和精确命名关系在摘要中只给出方向性描述,完整定义需查看全文;待核实。
  • 实验的模型规模、超参数、基线设置、nanoGPT speedrun 的具体任务和资源未在摘要中给出;待核实。
  • “每参数 1 bit”与“每方向 1 bit”的计数口径在摘要中未展开;待核实。
  • 作者单位、是否经同行评审、代码是否开源等信息不在摘要中;待核实。
  • “线性函数上上升”是构造性反例,不代表所有实际任务都会发散。

可用于图书/PPT/简报的角度

  • 低比特通信下的新优化器:Muon 也能做到 1 bit?
  • 误差反馈的边界:为什么不能随便作用在优化器输出上?
  • 理论与实践的倒挂:一个被证明发散的压缩方法为何在 CIFAR/nanoGPT 上最好?

原始材料

  • 英文标题:Sign compression for Muon: SignMuon, MuonSign, and the Limits of Error Feedback
  • 英文关键词:SignMuon; MuonSign; MuonUSign; Error feedback; Sign compression; Matrix-aware optimizer; Nonconvex optimization; Communication-efficient training
  • arXiv ID:2607.29674v1
  • 作者:Maria Smirnova, Alexey Kravatskiy
  • 发布日期/更新日期:2026-07-31
  • 分类:math.OC(Primary),cs.LG(Cross)
  • 链接:https://arxiv.org/abs/2607.29674v1
  • PDF:https://arxiv.org/pdf/2607.29674v1