知识卡片:训练通信高效的混合专家语言模型:通过层重配置
一句话结论
CE-MoE 通过将专家层集中到少数路由 MoE 层、同时增加额外 token-mixing 层与稠密 FFN 层来保持深度,在匹配总参数和激活参数的条件下,相比常规 full-MoE 模型降低了训练成本;在 31.5B 规模下,GPU 小时使用减少 33.3%,并提高了平均下游得分和推理吞吐量。
事件概述或研究问题
- 研究问题:使用专家并行(expert parallelism)训练混合专家(Mixture-of-Experts, MoE)语言模型时,all-to-all 的 token 分发与合并集合通信可能占用端到端训练时间的很大一部分。
- 该工作提出通信高效的 MoE 模型(CE-MoE),采用异构层模式,将 token-mixing 的深度与 channel-mixing 的深度解耦。
方法/产品要点
- 传统模型通常在每个 token-mixing 层(如 attention、Mamba-2)之后交错放置 MoE 层。
- CE-MoE 将专家容量集中在少数几个路由 MoE 层,同时通过增加额外的 token-mixing 层和稠密前馈(dense-FFN)层来维持模型深度。
- 具体层重配置的规则、层数比例、路由专家数量等细节:待核实(摘要未提供)。
主要结果或产业意义
- 在总参数从 2B 到 31.5B 的缩放阶梯上,匹配总参数和激活参数时,CE-MoE 一致降低训练成本,同时匹配 full-MoE 基线的验证损失和下游基准。
- 在 31.5B 规模下,CE-MoE 相比 full-MoE 基线的 GPU 小时使用减少 33.3%,并提高了平均下游得分和推理吞吐量。
为什么重要
- 该工作把通信开销作为 MoE 模型层配置的核心设计目标,显示出仅通过重新安排层类型,也能在相同参数规模下获得训练效率收益。
- 与已有相关卡片中的 Robust CurveMoE(侧重对抗防御)不同,本条关注 MoE 语言模型在分布式训练中的通信效率问题,属于基础模型训练优化的增量信息。
局限与不确定性
- 摘要未给出具体评测任务、数据集和下游基准数量,待核实。
- 摘要未说明 CE-MoE 实验采用的 token-mixing 层类型(如 attention 或 Mamba-2)及具体层配置,待核实。
- 摘要未提供收敛曲线、吞吐量、内存占用等细节,待核实。
- “匹配验证损失和下游基准”是否在所有规模下均无统计显著差异,待核实。
可用于图书/PPT/简报的角度
- 用“把专家集中到少数位置”的直观类比,解释 MoE 训练中的通信瓶颈与层排列的关系。
- 用“同参数量下通过结构重排减少 1/3 算力”的结果,作为高效大模型训练的案例。
- 用于说明大模型训练优化不仅依赖算法或硬件,层的空间排列也会显著影响分布式通信成本。
原始材料
- 英文标题:Training Communication-Efficient Mixture-of-Experts Language Models with Layer Re-Configuration
- 英文关键词(根据标题与摘要提取):Mixture-of-Experts, communication-efficient, layer re-configuration, expert parallelism, all-to-all dispatch
- 来源 URL:https://arxiv.org/abs/2608.28511v1
- 作者:Simeng Sun, Roger Waleffe
- 发布时间:2026-08-28