mbzuai-oryx

Awesome-LLM-Post-training

mbzuai-oryx

Awesome Reasoning LLM Tutorial/Survey/Guide

AI 简介

这是一个聚焦大语言模型(LLM)后训练技术的资源整理项目,系统梳理面向推理能力提升的Post-training方法。核心涵盖微调(Fine-tuning)、基于人类反馈的强化学习(RLHF)、奖励建模、测试时缩放(Test-time Scaling)等关键技术路径,并整合代表性论文、开源实现与评测基准。项目强调推理能力优化,适用于需要提升LLM逻辑推演、多步决策与复杂任务泛化能力的研究与工程场景,如智能体开发、科学问答与自主规划系统构建。

Python
2.5k
Stars
163
Forks
26
Watchers
7
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分55.64
默认分支main