观点 / 方法精选
Cohere 详解 North Mini Code 的 megakernel 推理引擎,单 H100 上比 vLLM 快 1.25–1.41 倍
原始标题:Inside the megakernel serving engine for North Mini Code
内容摘要
Cohere 发布为 North Mini Code 构建的围绕 decode megakernel 的推理引擎,BF16 下单张 H100 端到端解码吞吐比 vLLM 快 1.25–1.41 倍,batch size 1 时达 292 tok/s(SoL 的 62%),代码已在 GitHub 开放。
内容分类AI 观点与方法
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Cohere Labs:官方研究博客
站内情报编号intel-9a4a0ffbdab914c08bdaefb2