热点事件持续更新
研究提出优化MoE预训练All-to-All通信开销新方案
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月8日,arXiv发布关于MoE预训练优化的研究论文。针对MoE预训练中的专家路由相关性,研究提出了相关专家放置与Token重排两项优化技术,旨在降低All-to-All通信开销。在Megatron-LM框架的测试中,该方案在专家并行(EP)8至64的配置下将All-to-All通信时间缩短1.16至2.63倍,端到端单步训练速度提升最高达1.41倍,同时保持底层路由决策和模型参数不变。
AI 根据报道生成 · 3 小时前更新
最新进展10月8日 12:00
研究提出相关专家放置与Token重排技术,在Megatron-LM中将训练速度最高提升1.41倍。报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv 自然语言处理MoE 预训练中的专家耦合:通过相关放置与 Token 重排降低 All-to-All 开销
研究提出相关专家放置与 Token 重排两项优化技术,利用 MoE 预训练中专家路由的相关性大幅降低 All-to-All 通信开销。在 Megatron-LM 中,该方案在 EP 8 至 64 的设置下将 All-to-All 通信时间缩短 1.16 至 2.63 倍,端到端单步训练速度提升高达 1.41 倍,且不改变模型的底层路由决策与参数。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。