THUDM

slime

THUDM

slime is an LLM post-training framework for RL Scaling.

AI 简介

slime 是一个面向大语言模型(LLM)后训练阶段的强化学习(RL)规模化框架。它通过深度集成 Megatron 训练引擎与 SGLang 推理服务,支持高性能、低延迟的 RLHF/RLAIF 训练;同时提供灵活的数据生成接口,允许用户自定义 rollout、奖励建模与数据缓冲流程。框架设计解耦训练与推理模块,支持异步、多模型(如 GLM、Qwen、DeepSeek、Llama 系列)的 RL 微调任务,适用于学术研究与工业级 LLM 对齐优化场景。

Python
Apache License 2.0
7.8k
Stars
1.1k
Forks
28
Watchers
218
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分40.15
默认分支main