
FlashQwen
frankkk96
From-scratch C++/CUDA inference engine for Qwen3-8B
AI 简介
FlashQwen 是一个专为 Qwen3-8B 模型设计的轻量级、端到端 C++/CUDA 推理引擎,采用 Go 语言封装提供易用接口。核心功能包括:从零实现的 INT8 权重量化、连续批处理(continuous batching)与分页注意力(PagedAttention),不依赖 PyTorch/cuBLAS/HF Tokenizers 等第三方 ML 库;Go 层负责分词、ChatML 模板渲染、工具调用识别,并提供 OpenAI 兼容 API 和交互式 CLI。项目聚焦单一模型路径,代码精简、无抽象层,适合追求可控性、低依赖和快速迭代的本地部署场景,如私有化 AI 服务、边缘推理验证或教学研究。
Go
82
Stars
3
Forks
1
Watchers
0
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分38.81
默认分支main