论文研究普通
Random Attention 提出随机驱逐 KV cache 以提升长推理效率
原始标题:Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning
内容摘要
Salesforce AI Research 提出 Random Attention,不对缓存 token 打分,而是保留提示词并在每个注意力头内均匀随机驱逐,在四个模型、六个推理任务上匹配最强先验驱逐方法,vLLM 部署下吞吐量高出 32-43%。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-2e6a81b2dc559a1eb5762fef