AI圈报
产品发布 / 更新精选

cuLA:用 CUDA 重写线性注意力

信息来源:蚂蚁百灵:Developer Blog(网页)·

内容摘要

cuLA是一套面向GLA、KDA等线性注意力变体的高性能CUDA内核库。它通过手工优化的CuTe DSL与CUTLASS C++实现,深度适配NVIDIA Hopper和Blackwell等新一代GPU架构,旨在将复杂算法转化为可直接调用的高性能算子。其接口与flash-linear-attention保持一致,开发者仅需修改一行import即可低成本接入。性能测试显示,其内核在Blackwell和Hopper GPU上相比Triton基线实现,平均加速比最高达1.52倍。该项目已开源,并计划未来集成至FLA的统一调度机制中。
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源蚂蚁百灵:Developer Blog(网页)
站内情报编号intel-4be86997287c9d247aa8b2c4