Enping-Hu

minimind-deep-dive

Enping-Hu

从 MiniMind 源码读起,再延伸到现代大模型技术体系的中文学习笔记。主线逐行精读预训练 / SFT / DPO / PPO / GRPO 与训练机制;附录 17 篇进阶卷覆盖量化、投机解码、RLHF 全景、模型代际史等 MiniMind 没涉及、但进阶绕不开的主题。

AI 简介

这是一个面向中文学习者的大型语言模型(LLM)源码精读与技术体系解析项目,以MiniMind开源模型为切入点,逐行对照其Python源码并系统延伸至大模型训练全栈技术。核心涵盖预训练、监督微调(SFT)、直接偏好优化(DPO)、近端策略优化(PPO)及广义奖励策略优化(GRPO)等主流训练范式,统一梳理从logits到参数更新的数学链路,并提供MiniMind2与MiniMind-3版本差异对照及真实训练实验数据。适合希望深入理解LLM底层实现、训练机制与技术演进路径的研究者、工程师和进阶学习者。

Python
Creative Commons Attribution 4.0 International
191
Stars
11
Forks
1
Watchers
0
Issues

Star 增长

今日0
近 7 天0
近 30 天+95
综合评分52.74
默认分支main