AIDC
← 返回全部动态
NVIDIA Developer BlogAI 评分 75/10009月15日 00:39

利用 NVIDIA Transformer Engine 加速 JAX 下的无丢弃 MoE 训练

混合专家模型(MoE)已成为当前大模型训练的主流架构趋势,如 DeepSeek、Qwen 和 Mixtral 等模型均采用了该方案。针对 MoE 训练过程中的计算与通信开销,技术团队探讨了如何利用 NVIDIA Transformer Engine 在 JAX 深度学习框架下实现无丢弃(Dropless)MoE 模型的高效训练加速,进一步优化大语言模型的训练性能与资源利用率。

推荐理由介绍了使用英伟达 Transformer Engine 加速 JAX 框架下 MoE 大模型训练的系统级技术实践。

原标题:Accelerating Dropless MoE Training in JAX with NVIDIA Transformer Engine

阅读 NVIDIA Developer Blog 原文 ↗