AI圈报
模型发布 / 更新普通

使用 NVIDIA Transformer Engine 在 JAX 中加速无丢弃 MoE 训练

信息来源:NVIDIA Technical Blog:Agentic AI / Generative AI·
原始标题:Accelerating Dropless MoE Training in JAX with NVIDIA Transformer Engine

内容摘要

NVIDIA 介绍如何用 Transformer Engine 配合 JAX 优化 dropless MoE 训练。在 GB200 上训练 DeepSeek-V3 时,未优化基线仅 103 TFLOPS/GPU、GPU 间通信占内核时间 84%,经内核优化后提升至 1,068 TFLOPS/GPU,达 10.4 倍。
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源NVIDIA Technical Blog:Agentic AI / Generative AI
站内情报编号intel-59246eaf5f4809e69a6b6a16