AI圈报
观点 / 方法普通

vLLM 用 Helion 打造高性能可移植线性后端

信息来源:PyTorch:Blog(RSS)·
原始标题:Building a High-Performance and Portable vLLM Linear Backend with Helion

内容摘要

vLLM 将 Helion 集成进线性后端,用单一 GEMM 实现覆盖 Standard GEMM、Split-K、Swap-AB 等变体,并按 shape 自动调优选择最优配置。在 NVIDIA Hopper GPU 上,该后端结合逐 shape 调优与混合调度,在评测模型上超过 vLLM 默认的 CUTLASS 和 DeepGEMM 后端,部分负载吞吐提升超 10%。
内容分类AI 观点与方法
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源PyTorch:Blog(RSS)
站内情报编号intel-454412eaa47ef4cb87c7ba52