SigmanticAI

apex-inference-chip

SigmanticAI

An inference chip design that runs a real LLM (Qwen2.5-0.5B) on FPGA — one transformer decoder layer in RTL, every silicon value bit-exact against a golden model. 0.56 tok/s measured, a 140× climb, full evidence trail.

AI 简介

APEX-Inference-Chip 是一个面向边缘端大语言模型推理的开源 FPGA 加速器设计,专为高效运行真实 LLM(如 Qwen2.5-0.5B)而构建。其核心是一整层 Transformer 解码器的 RTL 硬件实现,覆盖注意力计算、KV 缓存压缩、RMSNorm、RoPE、SwiGLU 等全部关键算子,且每个模块均与 NumPy 黄金模型保持位级精确一致。项目首创将 KV 缓存压缩引擎深度集成至推理数据通路中,使内存带宽需求随上下文增长保持平稳。适用于资源受限、低延迟要求高的边缘 AI 推理场景,如嵌入式对话系统、本地化智能终端。

Python
Apache License 2.0
680
Stars
1
Forks
364
Watchers
0
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分44.9
默认分支main