deepseek-ai

FlashMLA

deepseek-ai

FlashMLA: Efficient Multi-head Latent Attention Kernels

AI 简介

FlashMLA 是 DeepSeek 开发的高效多头潜在注意力(MLA)内核库,专为大语言模型推理与训练优化设计。它提供密集型与稀疏型两种注意力实现,支持预填充(prefill)和解码(decoding)阶段,并创新性地在稀疏解码中采用 FP8 KV 缓存与 bfloat16 矩阵乘法混合精度方案,显著提升计算吞吐(最高达 640 TFlops 预填充、410 TFlops 解码)。基于 CUDA 实现,深度适配 NVIDIA H800/B200 等新一代 GPU 架构。适用于需要高性能、低延迟 LLM 推理服务或训练加速的场景,尤其适合部署 DeepSeek-V3 系列等采用 MLA 架构的模型。

C++
12.7k
Stars
1.1k
Forks
106
Watchers
68
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分66.11
默认分支main