
llm-compressor
vllm-project
Transformers-compatible library for applying various compression algorithms to LLMs for optimized deployment with vLLM
AI 简介
LLM Compressor 是一个面向大语言模型(LLM)推理部署优化的压缩工具库,专为与 vLLM 高效协同设计。它支持权重、激活值、KV 缓存及注意力机制的多种量化算法(如 NVFP4、FP8 块量化),提供与 Hugging Face Transformers 的无缝集成,并将压缩后模型保存为 vLLM 兼容的 compressed-tensors 格式;同时支持 DDP 训练和磁盘卸载,便于处理百亿至千亿参数模型。适用于需要在 NVIDIA GPU(尤其是 Blackwell 架构)上实现低延迟、高吞吐 LLM 推理服务的生产环境。
Python
Apache License 2.03.6k
Stars
601
Forks
30
Watchers
45
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分60.34
默认分支main