
bw24
avifenesh
From-scratch Rust+CUDA LLM inference engine for RTX 5090 (sm_120a) — NVFP4, MoE, MTP speculative decoding, tuned against measured hardware limits
AI 简介
bw24 是一个从零构建的 Rust + CUDA 大语言模型(LLM)推理引擎,专为 NVIDIA Blackwell 架构 RTX 5090 笔记本 GPU(sm_120a)优化。支持 NVFP4 低比特量化、MoE 模型高效加载与执行、MTP 驱动的多跳推测解码,并全部基于实测硬件极限手工调优 CUDA 内核,无需 ggml 或其他框架依赖。可直接加载 Hugging Face safetensors 或 GGUF 格式模型(如 Qwen3.6 MoE),在 24 GB 显存上运行远超显存容量的 121 GB MoE 模型。适用于追求极致硬件利用率、低延迟本地部署的 Blackwell 消费级 GPU 场景,尤其适合科研验证、边缘侧高性能 LLM 推理及定制化推理栈开发。
Rust
MIT License259
Stars
31
Forks
1
Watchers
0
Issues
Star 增长
今日0
近 7 天0
近 30 天+4
综合评分44.92
默认分支main