slime-n

slime-n

slime-n

A Multi-Policy, Multi-Agent RL Training Framework

AI 简介

slime-n 是一个面向多策略、多智能体强化学习的训练框架,支持灵活组合不同角色的策略组件(如可训练策略对、独立训练/冻结的Megatron模型、SGLang推理引擎)。其核心特点是采用声明式配置驱动架构,统一抽象策略为权重、优化器与缓冲区的单元,无需为每种训练范式(如非对称PPO、在线蒸馏、多智能体协作)编写定制化代码。适用于需要混合训练与推理后端、动态角色分工的大语言模型强化学习场景,尤其适合研究型团队探索复杂策略交互与系统级RL设计。

Python
Apache License 2.0
30
Stars
1
Forks
30
Watchers
4
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分40.9
默认分支main