Dao-AILab

flash-attention

Dao-AILab

Fast and memory-efficient exact attention

AI 简介

FlashAttention 是一个高效实现 Transformer 注意力机制的开源库,提供精确、快速且内存友好的注意力计算。其核心通过 IO 感知的分块算法(FlashAttention)、改进的并行化与工作划分(FlashAttention-2)、以及针对 Hopper/Blackwell 架构 GPU 的深度优化(FlashAttention-3/4),显著降低显存占用并提升训练/推理吞吐量。支持 FP16/BF16/FP8 精度,兼容 PyTorch,已广泛应用于大语言模型训练、长上下文推理和多模态模型加速等场景。

Python
BSD 3-Clause "New" or "Revised" License
24.4k
Stars
2.9k
Forks
149
Watchers
1k
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分70
默认分支main