Open-Reasoner-Zero

Open-Reasoner-Zero

Open-Reasoner-Zero

Official Repo for Open-Reasoner-Zero

AI 简介

Open-Reasoner-Zero 是一个开源的、面向大规模推理能力强化学习(RL)训练的轻量级实现框架。它聚焦于提升基础大模型在数学、科学等复杂推理任务上的性能,通过简化训练流程与参数配置,在AIME2024、MATH500和GPQA Diamond等基准上达到优于DeepSeek-R1-Zero的效果,同时仅需十分之一的训练步数。项目提供完整代码、训练数据、超参设置及多尺寸模型权重(0.5B–32B),支持快速复现与扩展。适用于AI研究者开展高效推理增强训练、AGI路径探索及教育/科研场景下的可复现RLHF研究。

Python
MIT License
2.1k
Stars
121
Forks
10
Watchers
19
Issues

Star 增长

今日0
近 7 天0
近 30 天+1
综合评分58.36
默认分支main