知识卡片:Muon 的符号压缩:SignMuon、MuonSign 与误差反馈的边界
英文标题:Sign compression for Muon: SignMuon, MuonSign, and the Limits of Error Feedback
英文关键词:SignMuon; MuonSign; MuonUSign; Error feedback; Sign compression; Matrix-aware optimizer; Nonconvex optimization; Communication-efficient training
一句话结论
SignMuon 将 Muon 更新逐元素取符号,压缩到每参数 1 bit,是在极低通信预算下运行矩阵感知优化器的一种最直接方式;它在实践中优于 SignSGD,但即使在线性函数上也可能上升。把符号放在 LMO 之前或两侧并不能普遍修复该问题;误差反馈只有作用在梯度上时才带来标准非凸收敛率。更反直觉的是,实验中理论上会发散的 sign-after-LMO 压缩方式反而最强。
事件概述或研究问题
论文研究 Muon(一种矩阵感知优化器)在低比特通信约束下的符号压缩。核心问题包括:
- 将 Muon 更新压缩为 1 bit(SignMuon)是否仍能保证下降?
- 符号应该加在 Linear Minimization Oracle(LMO)之前、之后,还是两侧?
- Error feedback(误差反馈)能否修复有偏压缩器带来的发散?
- 理论上可证明的收敛性与实际深度学习任务中的表现是否一致?
方法/产品要点
- SignMuon:对 Muon 更新取逐元素符号,每参数 1 bit。这是最直接的 1-bit 压缩方式。
- MuonUSign:论文中的 sign-before 变体,即在 LMO 之前对梯度取符号。精确公式待核实。
- MuonSign:论文中的 sign-on-both-sides 变体,即在 LMO 前后都取符号。精确公式待核实。
- EF21-MuonUSign / EF21-MuonSign:将误差反馈(EF21)作用于梯度,而不是作用于 Muon 输出的两个变体。
主要结果或产业意义
理论结果
- SignMuon 在实践中优于 SignSGD,但存在线性函数上目标上升的反例。
- 作者构造了一个小型显式实例,MuonUSign(sign-before)和 MuonSign(sign-on-both-sides)也会上升;因此没有一种符号放置方式能在一般情况下保证下降。
- 对 Muon 输出施加误差反馈:可以在任意光滑常数、步长和动量下失败。
- 对梯度施加误差反馈:EF21-MuonUSign 和 EF21-MuonSign 在光滑非凸问题上达到标准 $\mathcal{O}(T^{-1/2})$ 的平方梯度范数速率;其中 EF21-MuonSign 以每个方向 1 bit 实现该速率。
实验与实践结果
- 在 centralized CIFAR-10、federated CIFAR-10 和 nanoGPT speedrun 上,最强的压缩方法始终是 sign-after-LMO,即论文证明会发散的那一侧。
- 可证明收敛的变体在实际表现上落后于该启发式。论文对此的表述是:在这些规模上,LMO 之后的压缩(一个启发式)比理论保证更重要。
为什么重要
- 这是对 Muon/SOAP 优化器研究脉络的通信压缩补充:已有相关卡片关注 Muon/SOAP 在训练精度和收敛速度上的收益;本条补充的是低比特通信下的收敛性边界与误差反馈的适用位置。
- 它说明误差反馈并非天然有效:同样是有偏压缩,作用在 Muon 输出上可能失败,作用在梯度上却可得到标准收敛率。
- 它提供了一个理论保证与实践表现明显错位的案例:被证明发散的压缩方式在多个实际任务中仍是最强方法。
与既有脉络的关系
已有卡片记录了 SOAP/Muon 类优化器在机器学习原子间势训练上的优势;本卡片聚焦同一类优化器在通信压缩场景下的表现,不重复 MLIP 的精度结论,而是讨论“如果要把 Muon 更新压缩到 1 bit,误差反馈还能不能提供理论保证”。
局限与不确定性
- SignMuon、MuonUSign、MuonSign 的完整公式和精确命名关系在摘要中只给出方向性描述,完整定义需查看全文;待核实。
- 实验的模型规模、超参数、基线设置、nanoGPT speedrun 的具体任务和资源未在摘要中给出;待核实。
- “每参数 1 bit”与“每方向 1 bit”的计数口径在摘要中未展开;待核实。
- 作者单位、是否经同行评审、代码是否开源等信息不在摘要中;待核实。
- “线性函数上上升”是构造性反例,不代表所有实际任务都会发散。
可用于图书/PPT/简报的角度
- 低比特通信下的新优化器:Muon 也能做到 1 bit?
- 误差反馈的边界:为什么不能随便作用在优化器输出上?
- 理论与实践的倒挂:一个被证明发散的压缩方法为何在 CIFAR/nanoGPT 上最好?
原始材料
- 英文标题:Sign compression for Muon: SignMuon, MuonSign, and the Limits of Error Feedback
- 英文关键词:SignMuon; MuonSign; MuonUSign; Error feedback; Sign compression; Matrix-aware optimizer; Nonconvex optimization; Communication-efficient training
- arXiv ID:2607.29674v1
- 作者:Maria Smirnova, Alexey Kravatskiy
- 发布日期/更新日期:2026-07-31
- 分类:math.OC(Primary),cs.LG(Cross)
- 链接:https://arxiv.org/abs/2607.29674v1
- PDF:https://arxiv.org/pdf/2607.29674v1