0xwilliamortiz

FlashKDA

0xwilliamortiz

FlashKDA: memory-efficient KDA kernels for training and decode

AI 简介

FlashKDA 是一个面向 Kimi 系列 Delta Attention(KDA)模型的高性能、内存高效的 CUDA 内核库,专为训练与推理阶段的 chunked KDA 计算优化。它基于 CUTLASS 构建,支持 SM90+ 架构和 CUDA 12.9+,提供低显存占用的前向计算,集成于 flash-linear-attention 框架中作为可自动调度的后端。核心特性包括内核级门控(gate)、beta sigmoid 激活、q/k L2 归一化及状态布局转置等优化选项。适用于长序列建模、状态空间模型(SSM)变体(如 Kimi-K2/K3、Moonshot-AI 系列)的高效训练与部署场景。

Cuda
MIT License
193
Stars
27
Forks
64
Watchers
0
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分44.34
默认分支main