产品发布 / 更新普通
vLLM 推出 Hybrid HiSparse 优化,让 GLM 5.3 在单节点 8× H200 上跑满 100 万上下文
原始标题:GLM 5.3 Optimizations, Part 1: Hybrid HiSparse Offloading in vLLM
内容摘要
vLLM 团队为 GLM 5.3 引入 Hybrid HiSparse 混合稀疏卸载,在单个 8× H200 节点上首次实现 100 万完整上下文长度推理。该方法仅在 KV cache 压力出现时才将 top-K 之外的 KV 卸载到 CPU,热页与常驻页共享同一块池和张量,无需抢占或重新 prefill。