NVIDIA Developer Blog· Tanya Lenz·· 17 天前AI 评分22
NVIDIA Transformer Engine 加速 JAX 中的 Dropless MoE 训练
Accelerating Dropless MoE Training in JAX with NVIDIA Transformer Engine
AI 导读
NVIDIA 在 Transformer Engine 中为 JAX 带来 Dropless MoE 训练加速,针对 DeepSeek、Qwen、Mixtral 等 MoE 模型依赖的条件计算路径做优化。MoE 通过条件计算替代共享的稠密 FFN,能以更少训练算力达到或超过稠密模型的表现。
来源:NVIDIA Developer Blog · developer.nvidia.com