
slime
THUDM
slime is an LLM post-training framework for RL Scaling.
AI 简介
slime 是一个面向大语言模型(LLM)后训练阶段的强化学习(RL)规模化框架。它通过深度集成 Megatron 训练引擎与 SGLang 推理服务,支持高性能、低延迟的 RLHF/RLAIF 训练;同时提供灵活的数据生成接口,允许用户自定义 rollout、奖励建模与数据缓冲流程。框架设计解耦训练与推理模块,支持异步、多模型(如 GLM、Qwen、DeepSeek、Llama 系列)的 RL 微调任务,适用于学术研究与工业级 LLM 对齐优化场景。
Python
Apache License 2.07.8k
Stars
1.1k
Forks
28
Watchers
218
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分40.15
默认分支main