AI消息速览

UE5M3 FP4 块缩放:实现更简单稳定的语言模型预训练

事件日期 2026-09-02 · 学术前沿 · 已接受

事件日期2026-09-02
信息日期2026-09-02
入库日期2026-09-03
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:UE5M3 FP4 块缩放:实现更简单稳定的语言模型预训练

英文标题:UE5M3 FP4 Block Scaling for Stable Language Model Pretraining
英文关键词:FP4 pretraining; E2M1; E5M3 block scaling; selective stochastic rounding; low-bit language model pretraining

一句话结论

将 E2M1 FP4 载荷与无符号 E5M3 块缩放结合(即 UE5M3),并采用选择性随机舍入,可以在约 190B token 的 Nemotron-H 8B 预训练中取得比 NVIDIA Transformer Engine 参考配方更低的训练/验证损失和更高的下游量化推理点估计,同时省去随机 Hadamard 变换与 BF16 最终层豁免。

事件概述/研究问题

  • 稳定的 4 位浮点(FP4)预训练很困难,因为 FP4 的 E2M1 格式只能表示很窄的数值范围。
  • NVIDIA Transformer Engine 的参考配方依赖“当前张量缩放 + 随机 Hadamard 变换(RHT)+ BF16 最终层”来维持稳定,但这些操作加在了 FP4 矩阵乘法之外,增加了额外工作。
  • 本文尝试用另一种更简单、更利于硬件实现的配方解决 FP4 预训练稳定性问题。

方法/产品要点

  • 将 E2M1 FP4 有效载荷与无符号 E5M3 块缩放配对,利用 E5M3 更宽的指数范围实现周期性的张量缩放。
  • 在反向梯度上使用选择性随机舍入(selective stochastic rounding)。
  • 不采用随机 Hadamard 变换(RHT)。
  • 所有符合条件的内部线性层均使用 FP4;不设置 BF16 最终块豁免。
  • 预训练模型为 Nemotron-H 8B,训练近 1900 亿(190B)个 token。
  • 原文将所提配方称为 “block-16 recipe”;block-16 的具体块结构定义在摘要中未展开,待核实。

主要结果或产业意义

  • 与 Transformer Engine 配方相比,所提 block-16 配方获得了更低的最终窗口训练损失(final-window training loss)。
  • 在各自对应的量化推理策略下,所提配方的留出集负对数似然(held-out negative log-likelihood)也更低。
  • 量化推理的下游任务点估计在三个报告的聚合指标上均更高。
  • 原生执行消融中,同时移除 RHT 和 BF16 最终块豁免后,模型主体 token 吞吐量提升 21.2%。
  • 结果表明:在软件模拟条件下,端到端 UE5M3 FP4 预训练可以用更简单的配方达到更优结果,也说明硬件原生支持 E5M3 块缩放是有价值的。

为什么重要

  • 低位预训练是降低大模型训练/推理成本的重要方向,但 4 位浮点此前被认为难以稳定预训练;本文提供了 8B 规模、约 190B token 的对照证据。
  • 与在已有模型上做后训练低比特压缩不同,本文关注的是从预训练阶段就使用 FP4,属于“训练侧的低比特/量化”路线。
  • 它用“块缩放格式本身提供动态范围”的方式替代“在模型结构外增加额外矫正算子”的思路,为软硬件协同设计提供了新角度。
  • “更简单配方 + 更低损失 + 更高吞吐”的增量信息,比单纯报告压缩后的推理性能更进一步。

局限与不确定性

  • 摘要只报告点估计,未给出置信区间、多次运行标准差或显著性检验;下游任务具体清单与评测协议待核实。
  • 未披露训练超参数、学习率、批次大小、硬件配置和端到端训练时间,待核实。
  • “block-16”的具体块大小、缩放更新频率与范围设置未在摘要展开,待核实。
  • 消融中的“原生执行”具体指哪一软件/硬件执行路径,摘要未展开,待核实。
  • 实验只在 8B 单一模型规模上进行,更大规模模型上的稳定性和收益有待验证。

可用于图书/PPT/简报的角度

  • 对比叙事:NVIDIA 参考配方像“给窄量程仪器频繁校准”,本文 UE5M3 块缩放像“给每个小块一个更宽的量程旋钮”。
  • 可视化角度:画一张 RHT/BF16 豁免等“外围补救措施” vs 省略它们的对比图,配上 21.2% 吞吐提升。
  • 观点金句:“低比特不只是推理压缩工具,也可以成为预训练方式本身。”
  • 面向硬件听众:E5M3 块缩放若获得原生支持,可能进一步简化训练栈并提升效率。

原始材料

  • 英文标题:UE5M3 FP4 Block Scaling for Stable Language Model Pretraining
  • 英文关键词(建议索引):FP4 pretraining; E2M1; E5M3 block scaling; selective stochastic rounding; low-bit language model pretraining
  • 来源:arXiv:2609.02846v1 [cs.LG]
  • URL:https://arxiv.org/abs/2609.02846v1
  • PDF:https://arxiv.org/pdf/2609.02846v1
  • 作者:Robert Hu, Carlo Luschi, Paul Balanca
  • 页面显示提交/更新时间:2026-09-02