ztxz16

fastllm

ztxz16

fastllm是后端无依赖的高性能大模型推理库。同时支持张量并行推理稠密模型和混合模式推理MOE模型,任意10G以上显卡即可推理满血DeepSeek。双路9004/9005服务器+单显卡部署DeepSeek满血满精度原版模型,单并发20tps;INT4量化模型单并发30tps,多并发可达60+。

AI 简介

fastllm是一个轻量、无依赖的C++大语言模型推理引擎,专为高性能、跨硬件部署设计。它不依赖PyTorch等深度学习框架,通过自研算子实现FP8/INT4量化、张量并行(支持奇数卡)、GPU-CPU混合推理及MOE模型(如DeepSeek-R1 671B、Qwen-MoE)高效运行;兼容NVIDIA/AI加速卡(MI50、天数、沐曦、昇腾等)及ROCm平台,10GB显存即可单卡满精度运行DeepSeek R1。适用于边缘部署、私有化AI服务、多硬件统一推理平台等对低依赖性、高兼容性和实时吞吐有要求的生产场景。

C++
4.8k
Stars
476
Forks
59
Watchers
293
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分57.04
默认分支main