
nano-verl
kidding-404
A lightweight verl-style RL training framework.
AI 简介
nano-verl 是一个轻量级、从零实现的类 verl 强化学习训练框架,专为大语言模型的 RLHF(基于人类反馈的强化学习)训练优化。核心功能包括高可读性(代码仅约6k行)、基于 FSDP+vLLM 的分布式训练支持、动态批处理与去填充等高效推理调度能力,以及可选的一步离策略异步训练模式。技术上深度整合 Ray 分布式管理、FlashAttention 加速及 vLLM 推理后端,兼顾训练效率与工程简洁性。适用于学术研究、中小规模 RLHF 实验及资源受限环境下的 LLM 对齐训练场景。
Python
103
Stars
7
Forks
52
Watchers
0
Issues
Star 增长
今日0
近 7 天0
近 30 天+8
综合评分40.51
默认分支main