
auto-improving-kernel
jyotilakra92
暂无描述
AI 简介
这是一个面向GPU内核自动优化的实验性框架,通过AI代理自主编辑单个CUDA文件(kernel.cu)实现矩阵乘法(MatMul)内核的渐进式性能提升。核心采用git版本控制驱动的'keep/revert'闭环实验机制,结合固定基准测试、正确性校验与微秒级性能度量,支持共享内存分块、寄存器阻塞、bf16张量核心指令(fmaf)、异步加载(cp.async)等典型CUDA优化策略。适用于CUDA内核调优研究、AI代理驱动的系统软件探索及高性能计算教学实验场景。
Python
65
Stars
9
Forks
52
Watchers
0
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分37
默认分支main