
MSA
MiniMax-AI
暂无描述
AI 简介
MiniMax Sparse Attention(MSA)是一个面向NVIDIA SM100架构GPU优化的稀疏注意力计算库,提供JIT编译的密集FlashAttention与稀疏top-k注意力内核。核心功能包括支持BF16/FP8/NVFP4/FP4混合精度的稀疏前向计算、分页FP8解码,以及通过CuTe-DSL和C++ JIT双栈实现的高效动态编译。技术特点涵盖SM100专属指令集适配、运行时编译、低开销稀疏索引(sparse_topk_select)及与Hugging Face kernels生态的无缝集成。适用于大语言模型推理加速、长上下文处理及资源受限的高吞吐生成任务。
Python
MIT License372
Stars
38
Forks
6
Watchers
2
Issues
Star 增长
今日0
近 7 天0
近 30 天+15
综合评分43.27
默认分支main