观点 / 方法普通
LLM 推理性能核心框架:Prefill 拼算力,Decode 拼带宽,KV 缓存决定显存代价
原始标题:LLM 推理性能核心框架:同一个模型在"读"和"写"两个阶段,瓶颈完全不同,理解这一点是所有推理优化(量化、批处理、投机解码)的基础
内容摘要
作者整理了 llama.app 的推理概念文档(https://llama.app/docs/prefill-vs-decode),提出核心框架:Prefill 阶段并行读入 prompt、瓶颈在算力,Decode 阶段逐 token 自回归、瓶颈在内存带宽。
内容分类AI 观点与方法
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:邵猛 (@shao__meng)
站内情报编号intel-eacf7b16388a915015c07699