论文研究普通
BeaconKV:面向大型推理模型的高效键值缓存压缩方法
原始标题:BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference
内容摘要
BeaconKV提出一种无需训练的KV缓存压缩方法,通过维护beacon queries作为全局查询簇的紧凑代表,预测将被重新访问的KV对,解决长思维链推理中的内存瓶颈。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-27673dac28bfdf8c07bc2c6d