kacper-daftcode

vLLM-Moet

kacper-daftcode

A vLLM patch + hand‑written SM120 SASS kernels: 2‑bit MoE experts + an FP4 "delta" cache that recovers precision — matching the official (NV)FP4 checkpoint's quality on consumer Blackwell cards

AI 简介

这是一个针对消费级Blackwell显卡(如RTX 5090、RTX PRO 6000)优化的大规模MoE模型推理补丁,基于vLLM v0.24.0实现。核心功能包括:2-bit专家权重压缩与FP4增量缓存协同恢复精度;三级专家驻留机制(GPU内存→主机内存→NVMe存储),支持753B级GLM-5.2等前沿MoE模型在有限VRAM下运行;并集成NVFP4 KV缓存、MTP推测解码及工具调用解析能力。适用于资源受限环境下的超大规模MoE模型部署与推理服务场景。

Sass
Other
273
Stars
18
Forks
6
Watchers
1
Issues

Star 增长

今日0
近 7 天0
近 30 天+38
综合评分47.64
默认分支main