
vLLM-2080Ti-Definitive
weicj
The definitive vLLM runtime for dual RTX 2080 Ti 22GB + NVLink, delivering Qwen 27B local inference with 100+ tok/s single-request decode with support of FP8 weight
AI 简介
这是一个专为双RTX 2080 Ti(22GB + NVLink)硬件优化的vLLM推理运行时,旨在实现Qwen-27B等大模型在消费级显卡上的高性能单请求本地推理(100+ token/s)。项目集成了Marlin量化、FlashInfer/FA2、TurboQuant INT8 KV缓存、MTP张量并行及CUDA Graph等关键技术,并针对Turing架构深度调优。适用于预算有限但需部署27B–31B级开源大模型的个人开发者、研究者或轻量AI代理场景,强调单并发高吞吐与长上下文(最高256K)支持,不面向多租户或高并发服务。
Python
Apache License 2.0366
Stars
55
Forks
6
Watchers
3
Issues
Star 增长
今日0
近 7 天0
近 30 天+86
综合评分53.84
默认分支sm75-tp2-cu128-stable