
nanoPD
HJCheng0602
A from-scratch Prefill/Decode disaggregation inference engine for LLMs
AI 简介
nanoPD 是一个从零实现的 LLM 推理预填充(Prefill)与解码(Decode)分离引擎,专为提升大语言模型服务吞吐量而设计。它通过将计算密集型 Prefill 阶段与内存带宽受限的 Decode 阶段部署在不同 GPU 上,消除二者资源竞争;核心包含自研分页 KV 缓存、分块 Prefill、定制 CUDA 分页注意力内核、多卡 KV 传输机制及基于实时硬件测量的分析型路由策略。适用于高并发、长提示、混合请求负载下的 LLM 在线推理服务场景,尤其适合 H20 等多卡异构硬件环境。
Python
MIT License158
Stars
27
Forks
1
Watchers
1
Issues
Star 增长
今日0
近 7 天0
近 30 天+2
综合评分44.54
默认分支main