
glm-5.2-sm120
0xSero
GLM-5.2-NVFP4-REAP-469B serving on SM120 (4× RTX PRO 6000 Blackwell) — one-command vLLM launch recipe, 250K context, DeepSeek Sparse Attention + MTP speculative decode
AI 简介
这是一个面向高性能GPU集群的开源大语言模型推理部署方案,专为在4卡NVIDIA RTX PRO 6000 Blackwell(SM120架构)上高效运行GLM-5.2-NVFP4-REAP-469B MoE模型而设计。项目提供一键式Docker启动脚本,集成vLLM推理引擎,支持250K超长上下文、DeepSeek稀疏注意力、MTP推测解码、FP8 KV缓存及工具调用能力,并默认启用思维链推理输出。适用于需低延迟、高并发、长文本处理能力的私有化AI服务场景,如企业级智能助手、复杂逻辑推理API或研究型LLM沙盒环境。
Shell
144
Stars
9
Forks
2
Watchers
1
Issues
Star 增长
今日0
近 7 天0
近 30 天+3
综合评分40.3
默认分支main