AI圈报
模型发布 / 更新普通

LLM 为何缓存 K 和 V 却不缓存 Q

信息来源:X:马东锡 NLP (@dongxi_nlp)·
原始标题:https://x.com/i/article/2098863329817051136

内容摘要

这篇长文解释 LLM 推理中 KV cache 的原理:每生成一个 token,历史位置的 K/V 会被保留供后续位置读取,而 Q 随新位置重新产生,用完即可丢弃。
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:马东锡 NLP (@dongxi_nlp)
站内情报编号intel-dc550a2f00c24fec05b74424