教程 / 实战普通vLLM 在 GB300 NVL72 上 PD 部署 Qwen3.8-2.4T 的性能调优实录信息来源:vLLM 官方博客(RSS)·2026-09-21 08:00Qwen原始标题:PD Serving of Qwen3.8-2.4T内容摘要vLLM 在 GB300 NVL72 集群上对 Qwen3.8-2.4T 做 PD 分离部署,8K/1K 负载下高吞吐场景达到每 GPU 5000 total token 吞吐,低延迟场景每用户 180 生成 token,并给出完整 pareto 前沿。内容分类AI 教程与实战内容层级普通情报发布时间(北京时间)2026-09-21 08:00本站收录时间(北京时间)2026-09-21 20:42信息来源vLLM 官方博客(RSS)站内情报编号intel-000025b1c0865bfb83a6c3c9阅读原始信息 ↗查看数据来源更多教程 / 实战分享文章