[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"project-95977":3},{"id":4,"name":5,"fullName":6,"owner":7,"repo":5,"description":8,"homepage":9,"htmlUrl":9,"language":9,"languages":9,"totalLinesOfCode":9,"stars":10,"forks":11,"watchers":12,"openIssues":11,"contributorsCount":11,"subscribersCount":11,"size":11,"stars1d":11,"stars7d":11,"stars30d":11,"stars90d":11,"forks30d":11,"starsTrendScore":11,"compositeScore":11,"rankGlobal":9,"rankLanguage":9,"license":13,"archived":14,"fork":14,"defaultBranch":15,"hasWiki":16,"hasPages":14,"topics":17,"createdAt":9,"pushedAt":9,"updatedAt":24,"readmeContent":25,"aiSummary":26,"trendingCount":11,"starSnapshotCount":11,"syncStatus":27,"lastSyncTime":28,"discoverSource":29},95977,"llm-inference-capacity-handbook","shtjww\u002Fllm-inference-capacity-handbook","shtjww","大模型推理案头手册（开源版）：给定 GPU 算力，一个模型能扛多少 QPS？三层模型 × 三面墙 × 排队论 × 开环压测",null,104,0,101,"Other",false,"main",true,[18,19,20,21,22,23],"capacity-planning","gpu","llm-inference","llmops","queueing-theory","vllm","2026-09-21 02:04:29","# 大模型推理案头手册（开源版）\n\n**给定 GPU 算力，一个模型到底能扛多少 QPS？TTFT \u002F TPOT \u002F P95 怎么算？**\n\n中文圈讲 LLM 推理的内容，两头多、中间空：一头是“什么是 KV Cache”的入门科普，一头是 vLLM 源码逐行解析；而正中间这层——**给你 N 张卡，这套服务到底能接多少流量？P95 延迟敢不敢写进合同？要买多少台机器、花多少钱？**——系统的、能照着算出答案的手册，迄今少见。\n\n这本手册补的就是这一层：**容量规划（Capacity Planning）**。它不是推理技巧合集，也不是论文综述，而是一套闭环的实战体系——每个公式都配完整代入算例，每个方法都落到可直接照抄的 SOP，每个常数都追问“从哪来、误差多大、怎么测准”。从单机三面墙到排队论 P95，从开环压测到 500 万 DAU 的采购决策，一条链路打通。\n\n它不教你训练模型，也不教你调 kernel——它回答的是每个要做推理落地的人都绕不开、却一直在拍脑袋的问题。\n\n## 这本手册解决什么问题\n\n行业里大多数容量方案是错的，错法惊人地一致：\n\n- 拿**闭环压测**（并发打满）的吞吐当容量——它隐含 ρ=100%，而 ρ=100% 时排队等待趋于无穷；\n- 拿 **Decode 吞吐 ÷ 输出长度** 估 QPS——假装 Prefill 免费，2048\u002F512 负载下高估 ~4 倍；\n- 裸套公式不锚定——效率常数（MFU\u002FMBU）差 30% 到 10 倍，结论差出一倍预算。\n\n本手册把容量规划拆成**三层模型**，每层一套可算的公式：\n\n| 层 | 回答的问题 | 核心工具 |\n|---|---|---|\n| **物理层** | 理论上限多少？ | Roofline：Prefill 看算力，Decode 看带宽，并发看显存（KV Cache） |\n| **系统层** | 单节点实际能服务多少（λ_sat）？ | 三面墙取最小：算力墙 \u002F TPOT-SLA 墙 \u002F KV 槽位墙 |\n| **排队层** | 真实流量下 P50\u002FP95 多少？ | 排队论：E[W] ∝ ρ\u002F(1−ρ)，P95 在 ρ→1 时双曲线爆炸 |\n\n贯穿全书的三条纪律：**测出瓶颈在哪一层（不猜）；用富余资源换瓶颈资源（方向反了就是负优化）；动手前算阿姆达尔账（幅度 × 占比）**。所有效率常数必须**锚定**——用实测数据把公式常数钉死，裸用经验值误差 30% 起步。\n\n## 适合谁读\n\n- **推理平台 \u002F SRE \u002F 容量规划工程师**：三面墙、排队模型、开环压测 SOP 可直接照抄；\n- **技术管理者（CTO\u002F架构师）**：第 0 章一页纸 + 第 7 章成本换算与自建 vs 云，够支撑采购决策；\n- **售前 \u002F 交付**：要当着客户的面算\"你的生意要几台机器\"，第 7 章的七步流程和逐行推演是模板；\n- **性能\u002F仿真方向研究者**：第 5 章系统梳理了 Vidur、AIConfigurator、LLMServingSim 等五条仿真路线及各自的误差边界。\n\n**不适合**：想找 CUDA\u002F算子级调优技巧的读者（本手册明确不做引擎调优）；想找现成常数表照抄的读者（本手册只给区间和方法，常数必须自己锚定）。\n\n## 章节导航\n\n| 章 | 内容 | 你会得到什么 |\n|---|---|---|\n| [0. 速览与总纲](chapters\u002F00-速览与总纲\u002F) | 术语人话表、一页纸结论、三条纪律、符号公式速查卡 | 10 分钟建立全书地图；忘了公式回这章查 |\n| [1. 三层结构](chapters\u002F01-三层结构\u002F) | 饭店模型：为什么 70% 才是真实容量 | 识别三种典型错误方案 |\n| [2. 物理层](chapters\u002F02-物理层\u002F) | Prefill\u002FDecode 瓶颈、Roofline、KV Cache、吞吐三个口径 | 会算任何\"模型 × 卡\"的理论上限 |\n| [3. 系统层](chapters\u002F03-系统层三面墙\u002F) | 三面墙取 min、吞吐-延迟咬尾的闭式解、两个完整算例（72B×H100 \u002F 32B×H20）、负载画像、前缀缓存与 P\u002FD 分离修正 | 会算单节点 λ_sat，并知道每个数字从哪来 |\n| [4. 排队层](chapters\u002F04-排队层\u002F) | 排队论三分钟扫盲、M\u002FM\u002Fc 与 Allen–Cunneen、ρ~P95 对照表、峰值系数、LLM 特有的六个排队效应、100 请求突发的微观走查 | 会从\"物理上限\"推到\"真实体验\" |\n| [5. 仿真方法](chapters\u002F05-仿真方法\u002F) | 五条仿真路线谱系（纯 Roofline → Cycle 级）、Vidur\u002FAIConfigurator\u002FLLMServingSim 解剖、误差来源五层、选型决策树 | 看任何仿真报告能说出误差藏在哪一层 |\n| [6. 压测实战](chapters\u002F06-压测实战\u002F) | 三种压测形态十秒判定、协同遗漏、客户端 vs 服务端参数、开环 SOP、多轮对话压测、λ* 与 μ 两口径、Trace 回放 | 会设计压测、会拆穿别人的压测报告 |\n| [7. 端到端算例](chapters\u002F07-端到端算例\u002F) | 从零规划 vs 存量纠偏、500 万 DAU 客服完整算例（249 台逐行推演）、P\u002FD 分离对照（为什么反而费卡）、成本换算、自建 vs 云回本点、混合负载分配 | 会独立完成一次完整容量规划并交付报告 |\n| [8. 进阶专题](chapters\u002F08-进阶专题\u002F) | 投机解码（为什么大 batch 失效）、多模型路由、冷启动、多模态输入、非 Transformer 边界 | 知道\"省卡大招\"什么时候是负优化 |\n| [9. 集群与基础设施](chapters\u002F09-集群与基础设施\u002F) | TP\u002FPP\u002FDP 分工、五种网络通信量、拓扑与扩展效率、存储与冷启动介质、国产卡部署 MoE（EP 通信与 MLA） | 会做节点以上的集群级决策 |\n\n## 推荐阅读路径\n\n- **只有 10 分钟**：第 0 章（一页纸 + 三条纪律）；\n- **做采购\u002F汇报决策**：第 0 章 → 第 7 章；\n- **第一次做容量规划**：顺序通读，边读边用第 7 章算例练手；\n- **压测前夜**：直接第 6 章，SOP 可照抄；\n- **评审别人的方案**：第 1 章三种错误 + 6.2 十秒判定流程。\n\n## 开源范围说明\n\n本仓库为《大模型推理案头手册》（v8.0）的开源节选。完整版中的「常数的来源、误差与锚定」（原第 5 章）、MoE 完整算例（原 3.5 \u002F 8.4 节）、规划报告模板、误区清单与附录未包含在本版中。正文反复强调的\"锚定\"纪律完整保留——本版给你方法框架和公式，常数的实测方法属于完整版内容。文中 L1\u002FL2\u002FL3\u002FL4 为常数可信度分级：**L1 实测锚定 ＞ L2 仿真校准 ＞ L3 公开基准 ＞ L4 经验值**。\n\n## 完整版与联系\n\n完整版在开源版基础上增加了真正的“干货”部分：\n\n- **常数档案卡与锚定操作**：MFU\u002FMBU 实测锚定四步、误差预算表、效率常数获取四层级；\n- **实测锚定数据**：DeepSeek-R1 × H20、国产 64 卡 PD 分离集群等真实集群的锚定常数与回测案例；\n- **MoE 完整算例**：MoE 三面墙逐步走查、负载形态敏感性、EP 通信税的定量分析；\n- **工具与模板**：给领导的规划报告模板、误区清单 Top 19、附录速查表（GPU 参数 \u002F KV Cache \u002F vLLM & SGLang 参数）。\n\n需要完整版、详细数据，或容量规划咨询与合作，请联系作者：**yanwang_neu@126.com**\n\n内容纠错、讨论与建议请走 [Issues](..\u002F..\u002Fissues)，公开讨论大家都能受益。\n\n## License\n\n本作品采用 [CC BY-NC-SA 4.0](https:\u002F\u002Fcreativecommons.org\u002Flicenses\u002Fby-nc-sa\u002F4.0\u002Fdeed.zh-hans) 许可：可自由转载、改编，须署名、非商业使用、相同方式共享。\n","这是一本面向大模型推理落地的容量规划实战手册，系统回答‘给定GPU算力，服务能承载多少QPS及P95延迟’这一核心问题。手册提出三层建模框架：物理层（Roofline分析Prefill\u002FDecode瓶颈与KV Cache约束）、系统层（三面墙取最小值确定单节点饱和吞吐λ_sat）、排队层（基于ρ\u002F(1−ρ)关系推导真实流量下的P50\u002FP95延迟）。所有公式均配实测算例与SOP操作步骤，强调效率常数必须锚定实测、拒绝经验套用。适用于推理平台工程师、SRE、技术管理者及售前交付人员开展性能评估、资源采购与SLA承诺等生产级决策。",2,"2026-09-08 02:30:03","CREATED_QUERY"]