OpenRLHF

OpenRLHF

OpenRLHF

An Easy-to-use, Scalable and High-performance Agentic RL Framework based on Ray (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & Async RL)

AI 简介

OpenRLHF 是一个面向大语言模型对齐的开源强化学习人类反馈(RLHF)训练框架。它基于 Ray 和 vLLM 构建分布式架构,支持 PPO、REINFORCE++、DAPO 等主流 RL 算法,并采用统一的智能体(Agentic)执行范式,实现 SFT、奖励建模、多轮对话 RL 训练等完整 RLHF 流程。框架具备高扩展性、低资源开销和易用性,支持 LoRA 微调与异步 RL 训练。适用于需要高效微调大模型以对齐人类偏好的研究与工程场景,如对话系统优化、安全对齐、定制化指令微调等。

Python
Apache License 2.0
9.8k
Stars
981
Forks
52
Watchers
298
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分64.98
默认分支main