
autokernel
RightNow-AI
Autoresearch for GPU kernels. Give it any PyTorch model, go to sleep, wake up to optimized Triton kernels.
AI 简介
AutoKernel 是一个面向 PyTorch 模型的 GPU 内核自动优化工具,通过自主代理(AI agent)持续迭代优化 Triton 或 CUDA C++ 内核。其核心流程包括模型性能剖析、瓶颈内核提取、基于固定基准测试(含五级正确性校验与 roofline 分析)的自主编辑-验证-决策循环,并依据 Amdahl 定律动态调度优化优先级。支持 H100/A100/RTX 4090 等 NVIDIA GPU,单次实验约 90 秒,适合需在不修改模型逻辑前提下提升推理/训练吞吐量的场景,尤其适用于大语言模型(如 LLaMA、GPT-2)的底层算子加速。
Python
MIT License1.4k
Stars
148
Forks
11
Watchers
8
Issues
Star 增长
今日0
近 7 天0
近 30 天+17
综合评分56.22
默认分支main