知识卡片:UE5M3 FP4 块缩放:实现更简单稳定的语言模型预训练
英文标题:UE5M3 FP4 Block Scaling for Stable Language Model Pretraining
英文关键词:FP4 pretraining; E2M1; E5M3 block scaling; selective stochastic rounding; low-bit language model pretraining
一句话结论
将 E2M1 FP4 载荷与无符号 E5M3 块缩放结合(即 UE5M3),并采用选择性随机舍入,可以在约 190B token 的 Nemotron-H 8B 预训练中取得比 NVIDIA Transformer Engine 参考配方更低的训练/验证损失和更高的下游量化推理点估计,同时省去随机 Hadamard 变换与 BF16 最终层豁免。
事件概述/研究问题
- 稳定的 4 位浮点(FP4)预训练很困难,因为 FP4 的 E2M1 格式只能表示很窄的数值范围。
- NVIDIA Transformer Engine 的参考配方依赖“当前张量缩放 + 随机 Hadamard 变换(RHT)+ BF16 最终层”来维持稳定,但这些操作加在了 FP4 矩阵乘法之外,增加了额外工作。
- 本文尝试用另一种更简单、更利于硬件实现的配方解决 FP4 预训练稳定性问题。
方法/产品要点
- 将 E2M1 FP4 有效载荷与无符号 E5M3 块缩放配对,利用 E5M3 更宽的指数范围实现周期性的张量缩放。
- 在反向梯度上使用选择性随机舍入(selective stochastic rounding)。
- 不采用随机 Hadamard 变换(RHT)。
- 所有符合条件的内部线性层均使用 FP4;不设置 BF16 最终块豁免。
- 预训练模型为 Nemotron-H 8B,训练近 1900 亿(190B)个 token。
- 原文将所提配方称为 “block-16 recipe”;block-16 的具体块结构定义在摘要中未展开,待核实。
主要结果或产业意义
- 与 Transformer Engine 配方相比,所提 block-16 配方获得了更低的最终窗口训练损失(final-window training loss)。
- 在各自对应的量化推理策略下,所提配方的留出集负对数似然(held-out negative log-likelihood)也更低。
- 量化推理的下游任务点估计在三个报告的聚合指标上均更高。
- 原生执行消融中,同时移除 RHT 和 BF16 最终块豁免后,模型主体 token 吞吐量提升 21.2%。
- 结果表明:在软件模拟条件下,端到端 UE5M3 FP4 预训练可以用更简单的配方达到更优结果,也说明硬件原生支持 E5M3 块缩放是有价值的。
为什么重要
- 低位预训练是降低大模型训练/推理成本的重要方向,但 4 位浮点此前被认为难以稳定预训练;本文提供了 8B 规模、约 190B token 的对照证据。
- 与在已有模型上做后训练低比特压缩不同,本文关注的是从预训练阶段就使用 FP4,属于“训练侧的低比特/量化”路线。
- 它用“块缩放格式本身提供动态范围”的方式替代“在模型结构外增加额外矫正算子”的思路,为软硬件协同设计提供了新角度。
- “更简单配方 + 更低损失 + 更高吞吐”的增量信息,比单纯报告压缩后的推理性能更进一步。
局限与不确定性
- 摘要只报告点估计,未给出置信区间、多次运行标准差或显著性检验;下游任务具体清单与评测协议待核实。
- 未披露训练超参数、学习率、批次大小、硬件配置和端到端训练时间,待核实。
- “block-16”的具体块大小、缩放更新频率与范围设置未在摘要展开,待核实。
- 消融中的“原生执行”具体指哪一软件/硬件执行路径,摘要未展开,待核实。
- 实验只在 8B 单一模型规模上进行,更大规模模型上的稳定性和收益有待验证。
可用于图书/PPT/简报的角度
- 对比叙事:NVIDIA 参考配方像“给窄量程仪器频繁校准”,本文 UE5M3 块缩放像“给每个小块一个更宽的量程旋钮”。
- 可视化角度:画一张 RHT/BF16 豁免等“外围补救措施” vs 省略它们的对比图,配上 21.2% 吞吐提升。
- 观点金句:“低比特不只是推理压缩工具,也可以成为预训练方式本身。”
- 面向硬件听众:E5M3 块缩放若获得原生支持,可能进一步简化训练栈并提升效率。
原始材料
- 英文标题:UE5M3 FP4 Block Scaling for Stable Language Model Pretraining
- 英文关键词(建议索引):FP4 pretraining; E2M1; E5M3 block scaling; selective stochastic rounding; low-bit language model pretraining
- 来源:arXiv:2609.02846v1 [cs.LG]
- URL:https://arxiv.org/abs/2609.02846v1
- PDF:https://arxiv.org/pdf/2609.02846v1
- 作者:Robert Hu, Carlo Luschi, Paul Balanca
- 页面显示提交/更新时间:2026-09-02