vllm-project

production-stack

vllm-project

vLLM’s reference system for K8S-native cluster-wide deployment with community-driven performance optimization

AI 简介

vLLM Production Stack 是一个面向生产环境的大语言模型(LLM)推理服务部署参考方案,基于 Kubernetes 原生架构构建。它提供 Helm 管理的分布式 vLLM 部署能力,支持无缝扩缩容、多模型共存、请求智能路由及 KV 缓存卸载(集成 LMCache),并内置可观测性仪表盘。项目强调零应用代码修改即可从单机升级至集群部署,适用于需要高吞吐、低延迟、可运维的 LLM 服务场景,如企业级 AI API 平台、AI 应用后端与云服务商模型即服务(MaaS)基础设施。

Python
Apache License 2.0
2.4k
Stars
427
Forks
28
Watchers
96
Issues

Star 增长

今日0
近 7 天0
近 30 天+12
综合评分29.89
默认分支main