论文研究精选
在谷歌TPU上实现3倍加速:UCSD利用扩散式推测解码优化LLM推理
原始标题:Supercharging LLM inference on Google TPUs: Achieving 3X speedups with diffusion-style speculative decoding
内容摘要
加州大学圣地亚哥分校的研究团队在谷歌TPU上成功部署了DFlash,一种基于块扩散的推测解码方法。该方法突破传统自回归草稿生成的序列性瓶颈,通过单次前向传播并行"绘制"整个候选令牌块,而非逐个预测。系统平均实现了3.13倍的推理加速,峰值性能接近EAGLE-3等现有方法的两倍。这一开源方案已集成至vLLM生态系统,通过利用"免费"的并行验证能力和针对复杂推理任务的高质量草稿预测,显著优化了TPU硬件的利用效率。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Google Developers Blog(RSS)
站内情报编号intel-33f6373e593f1e0e0703aa11