AI圈报
模型发布 / 更新普通

KVMem 虚拟化百万 token 智能体工作区

信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI)·
原始标题:Nice paper to improve inference efficiency. It's been a while we haven't seen good work on efficien…

内容摘要

KVMem 将智能体超长工作区溢出内容以分页 KV 状态保存,分布于 GPU 内存、主机内存与 NVMe,并用模型原生轻量注意力索引选取相关历史块,在原生上下文窗口内物化查询相关视图。
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Elvis Saravia (@omarsar0, DAIR.AI)
站内情报编号intel-074d1890639894625e8e9b10