
mKernel
uccl-project
mKernel: fast multi-node, multi-GPU fused kernels
AI 简介
mKernel 是一个面向大规模分布式训练的高性能 GPU 内核融合框架,支持跨多 GPU 和多计算节点的单内核融合计算与通信。其核心能力包括:在单一 CUDA 持久化内核中统一调度计算(如 GEMM)、本地通信(NVLink)和远程通信(RDMA/IB),实现细粒度的 tile 级计算-通信重叠;基于 SM 角色特化(compute / send / reduce 等)和自研 GPU 驱动网络栈(绕过 NCCL/NVSHMEM,直驱 libibverbs)。适用于大模型训练中的 MoE、Ring Attention、AllGather+GEMM 等典型融合场景,尤其适合追求极致通信-计算重叠与端到端延迟优化的 HPC 与 AI 基础设施环境。
Cuda
MIT License249
Stars
24
Forks
1
Watchers
1
Issues
Star 增长
今日0
近 7 天0
近 30 天+8
综合评分44.99
默认分支main