
flash-attention
Dao-AILab
Fast and memory-efficient exact attention
AI 简介
FlashAttention 是一个高效实现 Transformer 注意力机制的开源库,提供精确、快速且内存友好的注意力计算。其核心通过 IO 感知的分块算法(FlashAttention)、改进的并行化与工作划分(FlashAttention-2)、以及针对 Hopper/Blackwell 架构 GPU 的深度优化(FlashAttention-3/4),显著降低显存占用并提升训练/推理吞吐量。支持 FP16/BF16/FP8 精度,兼容 PyTorch,已广泛应用于大语言模型训练、长上下文推理和多模态模型加速等场景。
Python
BSD 3-Clause "New" or "Revised" License24.4k
Stars
2.9k
Forks
149
Watchers
1k
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分70
默认分支main