NVIDIA Developer Blog· Tanya Lenz·· 17 天前AI 评分32
用 NVIDIA Transformer Engine 加速 JAX 中的 Dropless MoE 训练
Accelerating Dropless MoE Training in JAX with NVIDIA Transformer Engine
AI 导读
NVIDIA Transformer Engine 支持在 JAX 中加速 Dropless MoE 模型的训练。MoE 架构通过条件计算替代传统的单个共享稠密前馈网络(FFN),使 DeepSeek、千问(Qwen)与 Mixtral 等模型能以稠密模型更少比例的训练算力达到或超越其性能表现。
来源:NVIDIA Developer Blog · developer.nvidia.com