Luce-Org

lucebox-hub

Luce-Org

Fast LLM speculative inference server for consumer hardware.

AI 简介

Lucebox-Hub 是一个面向消费级硬件的高性能大语言模型(LLM)推测推理服务框架。它通过自研 CUDA/HIP 内核(如 Megakernel、DFlash、PFlash)、支持 speculative prefill 与 speculative decoding,并深度优化 GGUF 量化模型路径,显著提升本地 LLM 推理吞吐与首字延迟。项目专为 RTX 3090/5090 等主流显卡及 AMD ROCm 平台设计,适用于本地部署轻量级至中等规模模型(如 Qwen 系列)的低延迟交互场景,如桌面端 AI 助手、边缘设备推理和开发者原型验证。

C++
Apache License 2.0
2.6k
Stars
246
Forks
23
Watchers
25
Issues

Star 增长

今日0
近 7 天0
近 30 天+38
综合评分62.98
默认分支main