open-lm-engine

coda-kernels

open-lm-engine

CODA: Rewriting Transformer Blocks as GEMM-Epilogue Programs

AI 简介

CODA 是一个面向 GPU 的 Transformer 算子优化框架,将归一化、激活、残差更新和规约等操作融合进 GEMM 输出 tile 的 epilogue 阶段,实现硬件级效率与框架级易用性的统一。其核心基于 NVIDIA CUTLASS CuTeDSL,专为 Hopper 架构(如 H100)设计,支持 RMSNorm、SwiGLU、残差加法与部分规约等算子的细粒度融合。适用于大语言模型推理与训练中对计算密度和显存带宽敏感的 Transformer 块加速场景。

Python
226
Stars
23
Forks
4
Watchers
1
Issues

Star 增长

今日0
近 7 天0
近 30 天+5
综合评分41.64
默认分支main