论文研究普通
Flash-dLLM:面向扩散大语言模型的 IO 感知 KV 缓存与并行解码加速框架
原始标题:Flash-dLLM: IO-Aware KV Caching and Parallel Decoding for Fast, Memory-Efficient Diffusion LLMs
内容摘要
Flash-dLLM 是一个免训练的扩散大语言模型(dLLM)推理加速框架,通过 IO 感知的融合 KV 缓存内核和 KV 缓存驱动的 draft-and-verify 解码策略,让 dLLM 自身同时充当草稿模型与验证器。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-d455a137bb043585e779af07