AI圈报
论文研究普通

亚马逊论文:按KV缓存策略微调可防长上下文失效

信息来源:X:Rohan Paul (@rohanpaul_ai)·
原始标题:New Amazon paper shows KV-cache policy is not just an inference optimization; but it can change the …

内容摘要

亚马逊新论文表明,KV缓存策略不仅是推理优化,还能改变模型所需的训练方式。若模型推理时会遗忘部分上下文,训练时也应模拟这种遗忘--将微调与KV缓存策略匹配,可防止长上下文失效。在128k token测试中,全注意力微调模型在稀疏推理下常产生冗长无意义回答,而匹配缓存策略微调的模型能正常作答并停止;该方法支持任意缓存策略,可在40 GB A100上计算4B模型梯度。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-41413119b96e288c76dd3a32