
MTPLX
youssofal
2.24x decode TPS increase On Qwen 3.6 27B @ temp 0.6 | Native MTP Speculative Decoding On Apple Silicon With No External Drafter.
AI 简介
MTPLX 是一个专为 Apple Silicon 设计的本地大模型推理加速引擎,通过原生支持多令牌预测(MTP)的推测解码技术,在不依赖外部草稿模型的前提下提升解码吞吐量。其核心特点是基于 MLX 框架实现的数学精确拒绝采样、温度敏感的残差校正机制,以及对 Qwen3.6-27B 等模型内置 MTP 头的直接调用,在 temperature=0.6 等真实生成场景下达成 2.24 倍 token/s 提升。适用于 macOS 本地部署、低延迟交互式 AI 应用及资源受限环境下的高性能推理需求。
Python
Apache License 2.0940
Stars
63
Forks
14
Watchers
21
Issues
Star 增长
今日0
近 7 天0
近 30 天+86
综合评分58.02
默认分支main