AI消息速览

MALT:基于对角预条件子的轻量曲率感知Muon优化器

事件日期 2026-08-05 · 学术前沿 · 已接受

事件日期2026-08-05
信息日期2026-08-05
入库日期2026-08-07
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:MALT:基于对角预条件子的轻量曲率感知Muon优化器

英文标题:MALT: Lightweight Curvature-Aware Muon via Diagonal Preconditioning

英文关键词:Muon; preconditioning; curvature-aware; language model pretraining; optimizer

一句话结论

MALT 在 Muon 优化器中引入轻量的双侧对角预条件子,以近似损失曲面的曲率几何,从而降低 Muon 对曲率各向异性的敏感性;在 GPT-2 Small、Medium、Large 预训练实验中,MALT 优于 Muon,同时保持几乎相同的内存占用和墙钟时间。

事件概述或研究问题

Muon 是近期出现的语言模型预训练优化器,它通过牛顿-舒尔茨迭代对动量矩阵进行正交化,缓解了梯度各向异性,但并未显式考虑损失曲面的曲率几何,因此可能仍对曲率各向异性敏感。本文提出 MALT,旨在以较低内存和计算开销弥补这一缺口,使优化器能够近似感知曲率。

方法/产品要点

  • MALT 核心:使用双侧对角预条件子(two-sided diagonal preconditioners)以低开销近似损失曲面曲率。
  • 更新方向构造:对预条件后的动量执行牛顿-舒尔茨迭代进行正交化,再将结果映射回原空间以定义更新方向。
  • 更新幅度控制:引入范数嫁接(norm grafting)机制控制更新步长。
  • MALTER 扩展:进一步提出 MALT with Adaptive stEpsize Rescaling(MALTER),通过自适应步长缩放增强对随机梯度噪声的鲁棒性。
  • 理论保证:论文提供了 MALT 在随机非凸场景下的收敛保证。

主要结果或产业意义

实验覆盖 GPT-2 Small、Medium、Large 预训练任务,结果显示所提方法优于 Muon,且内存占用和墙钟时间与 Muon 几乎持平。这意味着在几乎不增加训练成本的情况下,可以提升语言模型预训练优化器的性能。具体性能提升幅度、收敛速度等数值细节待核实。

为什么重要

Muon 作为 AdamW 的潜在替代方案,其正交化操作只处理了梯度各向异性,而 MALT 显式引入曲率信息,增强了优化器对损失曲面几何的适应性。与已有相关卡片相比,本条聚焦优化器设计,属于底层训练算法层面的增量更新,不涉及特定任务或数据模态;它为语言模型预训练提供了一种“接近免费”的曲率感知增强思路。

局限与不确定性

  • 当前信息仅来自 arXiv 摘要,缺少完整论文中的实验设置、超参数选择、基线对比细节和消融实验。
  • MALTER 的具体自适应步长缩放机制、收敛性证明的假设条件等细节需从原文进一步核实。
  • “优于 Muon”的具体幅度、在不同模型规模和任务上的稳定性尚待确认。

可用于图书/PPT/简报的角度

  • 优化器演进:从 AdamW 到 Muon,再到加入曲率感知的 MALT。
  • 大模型预训练的效率与成本:在几乎不增加内存和时间开销的前提下改进优化器。
  • 数学方法应用:牛顿-舒尔茨迭代、对角预条件子、范数嫁接在深度学习优化中的组合。

原始材料

  • URL: https://arxiv.org/abs/2608.05088v1
  • PDF: https://arxiv.org/pdf/2608.05088v1
  • arXiv ID: 2608.05088v1
  • 作者:Tongle Wu, Huanyu Dong, Ying Sun, Ziye Ma
  • 发布时间:2026-08-05
  • 分类:cs.LG