renning22

glm-5.2-4090

renning22

First known correct serving of GLM-5.2 (DeepSeek-Sparse-Attention) on consumer RTX 4090 GPUs — a portable Ada/sm_89 port of the DSA kernel stack.

AI 简介

该项目实现了GLM-5.2(753B参数、FP8精度)大模型在消费级RTX 4090 GPU上的首次正确推理部署,核心是将DeepSeek-Sparse-Attention(DSA)稀疏注意力内核栈完整移植至Ada架构(sm_89),绕过原生仅支持Hopper/Blackwell的硬件限制。技术上提供可验证的FP8权重加载、多节点张量+流水线并行方案(TP=8×PP=4)、CUDA Graph优化及与sglang兼容的轻量级补丁机制,实测单流24 token/s、百并发下725 token/s吞吐。适用于需在低成本GPU集群上部署超大规模开源语言模型的科研、私有化AI服务与智能体开发场景。

Python
Apache License 2.0
62
Stars
13
Forks
52
Watchers
1
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分43.44
默认分支master