
shard
leyten
Pipeline-parallel LLM inference across GPUs on separate machines.
AI 简介
Shard 是一个支持跨机器 GPU 的流水线并行大语言模型(LLM)推理框架,专为超大规模模型在广域网(WAN)环境下的分布式部署而设计。它将模型按层切分为连续的分片(shard),每个 GPU 仅加载并运行对应分片,通过流式传递激活值完成端到端推理;结合异步流水线、环形直返通信、深度推测解码(spec-decode)与 CUDA Graph 加速等关键技术,显著缓解 WAN 延迟瓶颈,在 6 张跨州消费级 GPU 上实现 744B 参数 GLM-5.2 模型约 30 token/s 的可用吞吐。适用于无数据中心基础设施、资源分散、需验证推理来源可信性的边缘或协作式 AI 推理场景。
Python
Apache License 2.0426
Stars
56
Forks
8
Watchers
1
Issues
Star 增长
今日0
近 7 天0
近 30 天+28
综合评分48.07
默认分支master