
Awesome-LLM-Post-training
mbzuai-oryx
Awesome Reasoning LLM Tutorial/Survey/Guide
AI 简介
这是一个聚焦大语言模型(LLM)后训练技术的资源整理项目,系统梳理面向推理能力提升的Post-training方法。核心涵盖微调(Fine-tuning)、基于人类反馈的强化学习(RLHF)、奖励建模、测试时缩放(Test-time Scaling)等关键技术路径,并整合代表性论文、开源实现与评测基准。项目强调推理能力优化,适用于需要提升LLM逻辑推演、多步决策与复杂任务泛化能力的研究与工程场景,如智能体开发、科学问答与自主规划系统构建。
Python
2.5k
Stars
163
Forks
26
Watchers
7
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分55.64
默认分支main