教程 / 实战普通
NVIDIA 全栈 NIM 优化如何在 Nemotron 3 Ultra 上支撑 2.5 倍并发用户
原始标题:How Full-Stack NIM Optimizations Deliver 2.5x More Users on Nemotron 3 Ultra
内容摘要
NVIDIA 在 4xB200 系统上对 Nemotron 3 Ultra NIM 2.0.12 优化后,系统输出吞吐从基线的 718 tok/s 提升至 1,997 tok/s,在 50 TPS/user 目标下并发用户数提升超 2.5 倍。
内容分类AI 教程与实战
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源NVIDIA Technical Blog:Agentic AI / Generative AI
站内情报编号intel-210f33560d43d08b9e738d59