模型发布 / 更新普通
使用 NVIDIA Transformer Engine 在 JAX 中加速无丢弃 MoE 训练
原始标题:Accelerating Dropless MoE Training in JAX with NVIDIA Transformer Engine
内容摘要
NVIDIA 介绍如何用 Transformer Engine 配合 JAX 优化 dropless MoE 训练。在 GB200 上训练 DeepSeek-V3 时,未优化基线仅 103 TFLOPS/GPU、GPU 间通信占内核时间 84%,经内核优化后提升至 1,068 TFLOPS/GPU,达 10.4 倍。
内容分类AI 模型发布与更新
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源NVIDIA Technical Blog:Agentic AI / Generative AI
站内情报编号intel-59246eaf5f4809e69a6b6a16