观点 / 方法普通
vLLM 用 Helion 打造高性能可移植线性后端
原始标题:Building a High-Performance and Portable vLLM Linear Backend with Helion
内容摘要
vLLM 将 Helion 集成进线性后端,用单一 GEMM 实现覆盖 Standard GEMM、Split-K、Swap-AB 等变体,并按 shape 自动调优选择最优配置。在 NVIDIA Hopper GPU 上,该后端结合逐 shape 调优与混合调度,在评测模型上超过 vLLM 默认的 CUTLASS 和 DeepGEMM 后端,部分负载吞吐提升超 10%。