
DeepGEMM
deepseek-ai
DeepGEMM: clean and efficient BLAS kernel library on GPU
AI 简介
DeepGEMM 是一个面向现代大语言模型(LLM)推理与训练的高性能 GPU 张量核算子库,专注于优化各类矩阵乘法(GEMM)及融合计算原语。核心支持 FP8/FP4/BF16 混合精度 GEMM、MoE(专家混合)前向/反向、MQA 评分、HyperConnection 等 LLM 关键算子,并采用轻量级运行时 JIT 编译,无需预编译 CUDA 代码。设计简洁,依赖少,性能媲美或超越主流专家调优库,在 H800 等新一代 GPU 上可达 1550 TFLOPS。适用于 LLM 推理加速、MoE 架构部署、低延迟索引服务等对算子性能和灵活性要求高的场景。
Cuda
MIT License7.5k
Stars
1.1k
Forks
64
Watchers
57
Issues
Star 增长
今日0
近 7 天0
近 30 天+55
综合评分40.12
默认分支main