
cider
Mininglamp-AI
W8A8/W4A8 inference + optimized SDPA on Apple Silicon — unlocking unused INT8 TensorOps in M5 for 1.2–1.9× faster LLM prefill, plus FlashInfer-inspired GQA decode attention for up to 1.6× SDPA speedup, built as MLX custom primitives.
AI 简介
Cider 是一个专为 Apple M5 芯片优化的 LLM 推理加速库,基于 MLX 框架实现 W8A8 和 W4A8 量化推理支持。它通过自定义 Metal 张量运算内核(INT8 TensorOps)和在线激活量化,显著提升预填充阶段性能(1.2–1.9×),并集成 FlashInfer 风格的 GQA 解码注意力优化(SDPA 加速达 1.6×)。项目采用条件编译,仅在 M5+ 设备启用硬件加速,同时提供对 mlx_vlm 的非侵入式兼容补丁(如 Qwen3-VL 多图推理修复)。适用于 macOS 平台、追求低延迟与高能效比的本地大模型部署场景。
Python
MIT License333
Stars
16
Forks
4
Watchers
0
Issues
Star 增长
今日0
近 7 天0
近 30 天+1
综合评分43.79
默认分支main