AI消息速览

后Grokking崩溃——Muon训练Transformer在表示-读出接口的失效

事件日期 2026-08-07 · 学术前沿 · 已接受

事件日期2026-08-07
信息日期2026-08-07
入库日期2026-08-10
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:后Grokking崩溃——Muon训练Transformer在表示-读出接口的失效

一句话结论

在标准优化器分工下(Muon 负责隐藏矩阵,AdamW 负责 embeddings 和输出头),Muon 训练的 Transformer 在模加法上确实比 AdamW 更快 grok,但 grok 之后会出现“后 grokking 崩溃”:九种配置都在 $(a+b) \bmod 113$ 上先泛化、后丧失泛化;崩溃点位于“表示-读出接口”。

事件概述与研究问题

该论文研究的是 Muon 训练 Transformer 时出现的一种反常现象:模型在模加法任务上快速 grok,但训练继续推进后,已经得到的泛化能力无法保持。

  • 标准分工中,Muon 负责隐藏矩阵,AdamW 负责 embeddings 和输出头。
  • 所有九种 $(a+b) \bmod 113$ 配置都出现“grok 后崩溃”。
  • 不稳定性在两种模数、两种宽度、两种训练数据比例、减法任务以及不同深度设置中持续出现。

方法/产品要点

  • 任务包括模加法、减法,以及不同模数、宽度、训练数据比例和深度的配置。
  • 作者用“表示-读出接口”定位失败:该接口只能在联合意义上被识别,且相差一个不被损失函数选定的可逆映射。
  • 训练集被解决后,梯度降到约 $10^{-6}$ 量级,但优化器对步长的响应不同:
    • Muon 的步长弹性为 -0.03;
    • AdamW 的步长弹性为 +1.5;
    • Muon 参数组每参数移动速度快 8.0 倍。
  • 从 bit-identical 状态出发,冻结任一组参数都能阻止失败;冻结 embeddings/readout 可消除崩溃。
  • 移除 Muon 的归一化和正交化并不能替代冻结:表示从 326 个有效共轭对坍缩到 4 个,不再表现为反复崩溃,而是最终失败。
  • 傅里叶滤波被用来区分“电路失效”与“掩蔽”两种机制。

主要结果或产业意义

  • Muon 虽然能更快地 grok,但其解“不牢靠”,grok 后仍可能失去泛化。
  • 在五次种子中,被选中的 AdamW 参考在四次中低于阈值,其中一次达到 27.59%。
  • 冻结 embeddings/readout 的实验中:
    • 在五次运行、451,400 个 post-grokking 步骤和五对种子的设置中;
    • 未冻结分支记录了 137–321 次低于阈值的评估;
    • 冻结分支为 0 次。
  • 傅里叶分析显示,在 43 个检查点、五个种子、三种机制中,任务对齐的傅里叶族单独就能达到恰好 100%。这说明完整模型的错误有时不是“电路不存在”,而是正确的子电路被近乎等强度的对抗性剩余部分“投票压过”。
  • 当前应视为基础训练稳定性研究,直接产业意义有限;若在生产中使用 Muon,需要额外监测 grok 之后的泛化稳定性。

为什么重要

该结果挑战了“grok 之后就是稳定泛化”的直觉:grok 可能只是训练过程中的一个中间阶段,而不是终点。

更重要的是,崩溃点并不在普通的隐藏层表示中,而在表示-读出接口;常用傅里叶频谱指标也几乎看不出崩溃——在剧烈崩溃时,标准傅里叶支撑集不变,功率分布余弦仍为 0.9899。

与既有脉络的关系

本条与已有三张相关卡片没有直接延续:VLA 忠实性、图稀疏采样、视觉生成知识边界均不涉及 Muon/Transformer 的 grokking 问题。

本条提供的增量信息是:Muon 在模加法上 grok 更快,但在标准优化器分工下会经历“post-grokking collapse”;崩溃可定位到表示-读出接口,且可通过冻结 embeddings/readout 消除。

局限与不确定性

以下内容在摘要材料中未展开,需核对全文后方可确认:

  • 27.59% 具体指准确率还是其他指标,待核实;
  • “低于阈值”的阈值具体数值,待核实;
  • “步长弹性”的正式定义,待核实;
  • “326 个有效共轭对”的确切含义,待核实;
  • “被选中的 AdamW 参考”的选择方式,待核实;
  • 模型宽度、深度、训练数据比例、训练步数等具体数值,待核实;
  • 该结果是否能在非模运算任务或更大规模模型上复现,待核实。

可用于图书/PPT/简报的角度

  • “快 grok 不等于稳 grok”:优化器选择如何影响泛化的长期稳定性。
  • “训练损失降到 1e-6 之后,优化器行为差异仍可能导致泛化崩溃。”
  • “模型的错误答案可能内部也有正确答案电路”:用傅里叶滤波看完整模型 45.85% 与正确子电路 100% 的差异。
  • “冻结 readout 是稳定接口的干预手段”:从表示-读出接口角度理解深度学习中的后期崩溃。

原始材料

  • 英文标题:Post-Grokking Collapse at the Representation-Readout Interface in Muon-Trained Transformers
  • 英文关键词(据摘要提炼):post-grokking collapse;representation-readout interface;Muon;AdamW;modular arithmetic;Fourier filtering
  • 原始来源:arXiv:2608.07436v1
  • URL:https://arxiv.org/abs/2608.07436v1
  • 作者:Ali Janati, Kaoutar El Maghraoui, Andrei Kanavalau, Anass Belfatmi
  • 发布时间:2026-08-07T17:21:49Z
  • 分类:cs.AI, cs.LG