
PowerInfer
Tiiny-AI
High-speed Large Language Model Serving for Local Deployment
AI 简介
PowerInfer 是一个面向本地部署的高性能大语言模型(LLM)推理引擎,专为消费级 GPU 和 CPU 设计。其核心通过挖掘激活稀疏性(activation locality)与 TurboSparse 等稀疏化技术,在保持模型精度的同时显著提升推理吞吐量;支持 Llama、Mixtral 等主流架构,兼容 GGUF/GGML 格式及 ROCm/Windows 平台。适用于边缘设备、个人工作站及嵌入式场景下的低延迟、高性价比本地 LLM 服务,如离线问答、终端智能助手和私有化 AI 应用开发。
C++
MIT License9.7k
Stars
587
Forks
102
Watchers
124
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分39.31
默认分支main