观点 / 方法普通
vLLM x Novita AI:面向 Kimi K2.x 的 INT4 MoE 算子 Chord,H200 最高 1.3x、B300 最高 2.15x
原始标题:vLLM x Novita AI: Chord, Faster INT4 MoE for Kimi K2.x. Up to 1.3x on H200, 2.15x on Untuned B300
内容摘要
Novita AI 开源了面向 Kimi K2.x 服务形态的 W4A16 MoE CUDA 算子 Chord,支持 BF16 激活、INT4 权重与 group-32 scale,其 indexed 路径兼容 Humming 导入根,可通过 --quantization humming 在兼容的 vLLM 版本上启用。