
coda-kernels
open-lm-engine
CODA: Rewriting Transformer Blocks as GEMM-Epilogue Programs
AI 简介
CODA 是一个面向 GPU 的 Transformer 算子优化框架,将归一化、激活、残差更新和规约等操作融合进 GEMM 输出 tile 的 epilogue 阶段,实现硬件级效率与框架级易用性的统一。其核心基于 NVIDIA CUTLASS CuTeDSL,专为 Hopper 架构(如 H100)设计,支持 RMSNorm、SwiGLU、残差加法与部分规约等算子的细粒度融合。适用于大语言模型推理与训练中对计算密度和显存带宽敏感的 Transformer 块加速场景。
Python
226
Stars
23
Forks
4
Watchers
1
Issues
Star 增长
今日0
近 7 天0
近 30 天+5
综合评分41.64
默认分支main