AI圈报
观点 / 方法普通

vLLM 分层 KV Cache 卸载:跨主机内存、存储与远端节点复用 KV 数据

信息来源:vLLM 官方博客(RSS)·
原始标题:Tiered KV Cache Offloading in vLLM

内容摘要

vLLM 推出分层 KV Cache 卸载框架,自 v0.22 起可用,将淘汰的 KV 数据保留在主机内存、文件系统、对象存储和远端节点中,避免重新计算。该设计让所有 KV 数据先经主机内存流转,加速器内存可在拷贝完成后立即释放,并支持跨节点共享 KV 数据、横向扩展缓存与分离式服务。
内容分类AI 观点与方法
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源vLLM 官方博客(RSS)
站内情报编号intel-0a7965a51df8ed4b5dffb08d