跳到正文
原文
arXiv 自然语言处理· Radha Gulhane, Quentin Anthony, Beren Millidge·· 4 小时前AI 评分40

MoE 预训练中的专家耦合:通过相关放置与 Token 重排降低 All-to-All 开销

Expert Coupling in MoE Pretraining: Reducing All-to-All Overhead with Correlated Placement and Token Shuffling

AI 导读

研究提出相关专家放置与 Token 重排两项优化技术,利用 MoE 预训练中专家路由的相关性大幅降低 All-to-All 通信开销。在 Megatron-LM 中,该方案在 EP 8 至 64 的设置下将 All-to-All 通信时间缩短 1.16 至 2.63 倍,端到端单步训练速度提升高达 1.41 倍,且不改变模型的底层路由决策与参数。

来源:arXiv 自然语言处理 · arxiv.org