mll-lab-nu

RAGEN

mll-lab-nu

RAGEN leverages reinforcement learning to train LLM reasoning agents in interactive, stochastic environments.

AI 简介

RAGEN 是一个面向大语言模型推理智能体的强化学习训练框架,旨在诊断和优化RL训练过程中的失败模式。其核心基于StarPO(State-Thinking-Actions-Reward Policy Optimization)统一架构,支持轨迹级与步级联合优化,内置10个多样化交互式环境(如Sokoban、WebShop、Lean等),并提供Gym兼容接口便于扩展。项目强调对推理过程的可控干预、奖励机制设计及训练稳定性分析,适用于需要在复杂、随机环境中提升LLM代理推理鲁棒性与泛化能力的研究与开发场景。

Python
MIT License
2.8k
Stars
230
Forks
22
Watchers
28
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分59.09
默认分支main