观点 / 方法普通
IBM Research 展示用 llm-d 在 544 块 NVIDIA H100 上服务 GLM-5.2 智能体负载
原始标题:How llm-d makes the most of the hardware you already have
内容摘要
IBM Research 联合 Red Hat、Google 的开源项目 llm-d 展示在 544 块 NVIDIA H100 GPU 上部署 753B 参数的开放权重 MoE 模型 GLM-5.2(约 39B 激活),在数百到 3000 个并发编码智能体负载下峰值输出超 6.6M tokens 每分钟,零抢占。