跳到正文
原文
NVIDIA Developer Blog· Tanya Lenz·· 17 天前AI 评分22

NVIDIA Transformer Engine 加速 JAX 中的 Dropless MoE 训练

Accelerating Dropless MoE Training in JAX with NVIDIA Transformer Engine

AI 导读

NVIDIA 在 Transformer Engine 中为 JAX 带来 Dropless MoE 训练加速,针对 DeepSeek、Qwen、Mixtral 等 MoE 模型依赖的条件计算路径做优化。MoE 通过条件计算替代共享的稠密 FFN,能以更少训练算力达到或超过稠密模型的表现。

来源:NVIDIA Developer Blog · developer.nvidia.com