shtjww

llm-inference-capacity-handbook

shtjww

大模型推理案头手册(开源版):给定 GPU 算力,一个模型能扛多少 QPS?三层模型 × 三面墙 × 排队论 × 开环压测

AI 简介

这是一本面向大模型推理落地的容量规划实战手册,系统回答‘给定GPU算力,服务能承载多少QPS及P95延迟’这一核心问题。手册提出三层建模框架:物理层(Roofline分析Prefill/Decode瓶颈与KV Cache约束)、系统层(三面墙取最小值确定单节点饱和吞吐λ_sat)、排队层(基于ρ/(1−ρ)关系推导真实流量下的P50/P95延迟)。所有公式均配实测算例与SOP操作步骤,强调效率常数必须锚定实测、拒绝经验套用。适用于推理平台工程师、SRE、技术管理者及售前交付人员开展性能评估、资源采购与SLA承诺等生产级决策。

Other
104
Stars
0
Forks
101
Watchers
0
Issues

Star 增长

今日0
近 7 天0
近 30 天0
默认分支main