
rlhf-book
natolambert
Textbook on reinforcement learning from human feedback
AI 简介
这是一本关于人类反馈强化学习(RLHF)的开源教科书,系统讲解大语言模型后训练中的对齐技术原理与实践。项目包含完整的理论阐述、主流算法(如PPO、DPO、RLOO、拒绝采样等)的参考实现,以及奖励建模、指令微调、直接偏好优化等核心模块的可运行代码。基于Python构建,强调工程可复现性与教学实用性。适用于AI研究人员、大模型工程师及希望深入理解模型对齐机制的学习者,尤其适合开展RLHF实验、课程教学或工业级对齐方案预研。
Python
Other2.1k
Stars
223
Forks
28
Watchers
1
Issues
Star 增长
今日0
近 7 天0
近 30 天+31
综合评分62.15
默认分支main