AI圈报
产品发布 / 更新精选

Flash-KMeans:IO感知的精确K-Means,在GPU上比FAISS快200倍以上

信息来源:MarkTechPost(RSS)·
原始标题:Meet Flash-KMeans: An IO-Aware, Exact K-Means That Runs Over 200× Faster Than FAISS on GPUs

内容摘要

UC Berkeley与UT Austin团队开源Flash-KMeans(Apache 2.0,`pip install flash-kmeans`),精确实现标准Lloyd's k-Means,通过重构GPU数据流而非改变数学或近似来提速。在NVIDIA H200上,端到端速度比最佳基线快17.9×,比cuML快33×,比FAISS快200×以上。其FlashAssign核避免物化完整N×K距离矩阵,将IO复杂度从O(NK)降至O(Nd+Kd),单核加速最高21.2×;Sort-Inverse Update核通过排序聚类ID减少原子争用,单核加速最高6.3×。支持out-of-core处理,在1B数据点、K=32768时单次迭代仅41.4s。适用于向量搜索索引、稀疏注意力路由、KV缓存压缩等在线场景。
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源MarkTechPost(RSS)
站内情报编号intel-4bd0561d9251af944021de3c