Aryagm

dflash-mlx

Aryagm

Exact speculative decoding on Apple Silicon, powered by MLX.

AI 简介

dflash-mlx 是一个面向 Apple Silicon(M1/M2/M3)设备的精确推测解码(Exact Speculative Decoding)推理框架,基于苹果开源的 MLX 框架实现。它通过轻量级 draft 模型并行生成候选 token 块,并由高精度 target 模型一次性验证,显著提升本地大语言模型推理吞吐量;支持流式输出、OpenAI 兼容 API 及多种 Qwen 系列模型(如 Qwen3-4B),默认使用 BF16 精度,无需 GPU 即可高效运行。适用于在 Mac 设备上部署低延迟、高吞吐的本地 LLM 服务,尤其适合开发者构建离线聊天应用、本地 AI 工具链或资源受限环境下的模型推理服务。

Python
MIT License
382
Stars
35
Forks
5
Watchers
3
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分44.67
默认分支main