产品发布 / 更新精选
vLLM 引入硬件无关层以兼容 torch.compile 与 OOT 加速器
原始标题:Hardware-Agnostic Models in vLLM
内容摘要
vLLM 为追求前沿性能正转向硬件专用的 flat 模型定义,与 fullgraph torch.compile 不兼容,影响 OOT 加速器、旧 GPU 和较冷门模型的支持。
内容分类AI 产品发布与更新
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源PyTorch:Blog(RSS)
站内情报编号intel-0be1004eb2ac74a8d56d5c42