
dflash-mlx
bstnxbt
Lossless DFlash speculative decoding for MLX on Apple Silicon
AI 简介
dflash-mlx 是一个面向 Apple Silicon 的无损推测解码(speculative decoding)实现,基于 MLX 框架优化大语言模型推理速度。其核心采用 DFlash 算法:小型草稿模型通过块扩散(block diffusion)单次生成 16 个候选 token,目标模型在一次前向传播中完成全部验证,并仅提交经严格贪婪验证的 token 前缀,确保输出完全等价于目标模型自回归生成结果。项目深度集成 Metal 加速,包含 tape-replay 回滚、JIT 两遍 SDPA、int4 验证专用矩阵乘、bf16 数值一致性控制及分层前缀缓存(L1+L2)等关键技术。适用于 Apple 设备上对延迟敏感、要求输出严格一致性的本地 LLM 推理场景,如终端侧对话、实时代码补全与离线知识问答。
Python
Apache License 2.0742
Stars
56
Forks
4
Watchers
11
Issues
Star 增长
今日0
近 7 天0
近 30 天+6
综合评分49.87
默认分支main