skyzh

tiny-llm

skyzh

A course of learning LLM inference serving on Apple Silicon for systems engineers: build a tiny vLLM + Qwen.

AI 简介

这是一个面向系统工程师的LLM推理服务实践课程,聚焦于在Apple Silicon(Mac)上基于MLX框架从零构建轻量级大语言模型服务系统。项目以Qwen3模型为载体,逐步实现注意力机制、RoPE、KV缓存、连续批处理、Flash Attention 2及4-bit量化等核心推理优化技术,全程仅用Python和MLX原生API,不依赖PyTorch/TensorFlow等高层框架。适合希望深入理解LLM服务底层原理、在本地Mac环境开展高效推理实验或学习边缘端模型部署的开发者与系统工程师。

Python
Apache License 2.0
4.3k
Stars
340
Forks
37
Watchers
7
Issues

Star 增长

今日0
近 7 天0
近 30 天+29
综合评分62.5
默认分支main