AI圈报
观点 / 方法普通

NVIDIA Groq 3 LPX 跑出 Gemma 4 31B 最快推理速度

信息来源:X:Artificial Analysis (@ArtificialAnlys)·
原始标题:Artificial Analysis has measured 3,431 tokens/s on Gemma 4 31B via a private demonstration endpoint …

内容摘要

Artificial Analysis 实测 NVIDIA Groq 3 LPX 推理机架在私有端点上以 3,431 tokens/s 输出速度运行 Gemma 4 31B,为 100k 上下文下该模型最高实测速度。该机架已全面投产,将于今年晚些时候投入运营;在 10k 和 100k 输入长度下均保持约 3,400 tokens/s 的中位输出速度,长上下文推理性能稳健。
内容分类AI 观点与方法
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Artificial Analysis (@ArtificialAnlys)
站内情报编号intel-bcc1815e92bbad0c7b750e5c