syv-ai

qwen38-27b-rtx3090

syv-ai

Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

AI 简介

该项目提供在单张RTX 3090显卡(24GB显存)上高效部署Qwen3.8-27B大语言模型的完整推理方案,基于vLLM框架并集成多项深度优化。核心功能包括:支持150k–262k超长上下文、OpenAI兼容API、双模式运行(高吞吐batch模式与低延迟single-user模式)、int8张量核GEMM加速、MTP/DFLASH2推测解码、校准int4 lm_head、split-KV验证注意力及KV缓存优化。适用于本地私有化部署场景,如个人开发者调试、小团队内部AI服务、文档问答与长文本编辑等对延迟或上下文长度敏感的轻量级应用。

Python
Apache License 2.0
293
Stars
39
Forks
4
Watchers
4
Issues

Star 增长

今日0
近 7 天+136
近 30 天+136
综合评分74.81
默认分支main