deepseek-ai

DeepGEMM

deepseek-ai

DeepGEMM: clean and efficient BLAS kernel library on GPU

AI 简介

DeepGEMM 是一个面向现代大语言模型(LLM)推理与训练的高性能 GPU 张量核算子库,专注于优化各类矩阵乘法(GEMM)及融合计算原语。核心支持 FP8/FP4/BF16 混合精度 GEMM、MoE(专家混合)前向/反向、MQA 评分、HyperConnection 等 LLM 关键算子,并采用轻量级运行时 JIT 编译,无需预编译 CUDA 代码。设计简洁,依赖少,性能媲美或超越主流专家调优库,在 H800 等新一代 GPU 上可达 1550 TFLOPS。适用于 LLM 推理加速、MoE 架构部署、低延迟索引服务等对算子性能和灵活性要求高的场景。

Cuda
MIT License
7.5k
Stars
1.1k
Forks
64
Watchers
57
Issues

Star 增长

今日0
近 7 天0
近 30 天+63
综合评分71.42
默认分支main