跳到正文
热点事件持续更新

研究提出优化MoE预训练All-to-All通信开销新方案

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月8日,arXiv发布关于MoE预训练优化的研究论文。针对MoE预训练中的专家路由相关性,研究提出了相关专家放置与Token重排两项优化技术,旨在降低All-to-All通信开销。在Megatron-LM框架的测试中,该方案在专家并行(EP)8至64的配置下将All-to-All通信时间缩短1.16至2.63倍,端到端单步训练速度提升最高达1.41倍,同时保持底层路由决策和模型参数不变。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv 自然语言处理
    MoE 预训练中的专家耦合:通过相关放置与 Token 重排降低 All-to-All 开销

    研究提出相关专家放置与 Token 重排两项优化技术,利用 MoE 预训练中专家路由的相关性大幅降低 All-to-All 通信开销。在 Megatron-LM 中,该方案在 EP 8 至 64 的设置下将 All-to-All 通信时间缩短 1.16 至 2.63 倍,端到端单步训练速度提升高达 1.41 倍,且不改变模型的底层路由决策与参数。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。