InternLM

lmdeploy

InternLM

LMDeploy is a toolkit for compressing, deploying, and serving LLMs.

AI 简介

LMDeploy 是一个面向大语言模型(LLM)的轻量级推理部署与压缩工具包。它提供模型量化(支持4bit/FP8/MXFP4)、高效推理引擎(TurboMind/CUDA Kernel/PyTorch Engine)、多后端适配(CUDA/Ascend)及低延迟服务部署能力,兼容Llama、InternLM、Qwen、DeepSeek等主流开源模型。项目强调端到端优化,兼顾推理速度、显存占用与精度平衡,适用于私有化部署、边缘推理、AI服务中台等对性能与资源敏感的生产场景。

Python
Apache License 2.0
7.9k
Stars
702
Forks
55
Watchers
528
Issues

Star 增长

今日0
近 7 天0
近 30 天+22
综合评分66.74
默认分支main