vllm-project

llm-compressor

vllm-project

Transformers-compatible library for applying various compression algorithms to LLMs for optimized deployment with vLLM

AI 简介

LLM Compressor 是一个面向大语言模型(LLM)推理部署优化的压缩工具库,专为与 vLLM 高效协同设计。它支持权重、激活值、KV 缓存及注意力机制的多种量化算法(如 NVFP4、FP8 块量化),提供与 Hugging Face Transformers 的无缝集成,并将压缩后模型保存为 vLLM 兼容的 compressed-tensors 格式;同时支持 DDP 训练和磁盘卸载,便于处理百亿至千亿参数模型。适用于需要在 NVIDIA GPU(尤其是 Blackwell 架构)上实现低延迟、高吞吐 LLM 推理服务的生产环境。

Python
Apache License 2.0
3.6k
Stars
601
Forks
30
Watchers
45
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分60.34
默认分支main