
llama.cpp-MTP-TurboQuant
BoFan-tunning
暂无描述
AI 简介
这是一个基于 llama.cpp 的高性能大语言模型推理优化项目,集成了多令牌预测(MTP)推测解码与 TurboQuant KV Cache 压缩技术,显著提升推理吞吐(2–5倍)并大幅降低显存占用(KV Cache 节省约76%)。支持 Vision 多模态输入、Qwen 3.6 智能思考模板及健壮的 Tool Calling 渲染。需配合含 MTP 头部的定制 GGUF 模型使用,适用于本地部署高吞吐/低显存需求的 LLM 服务场景,如边缘设备推理、多用户 API 服务或资源受限环境下的多模态交互应用。
C++
MIT License135
Stars
26
Forks
1
Watchers
8
Issues
Star 增长
今日0
近 7 天0
近 30 天+9
综合评分42.19
默认分支merge-mtp-turboquant