
UniRL
Tencent-Hunyuan
UniRL is a Framework for Unified Multimodal Model Reinforcement Learning
AI 简介
UniRL 是一个面向统一多模态模型的强化学习框架,支持扩散模型、自回归模型、潜变量模型及统一架构的 RL 后训练。其核心特点是分层可组合架构,提供标准化 RL 循环(采样-打分-优势估计-策略更新-权重同步),集成 Flow-DPPO、DRPO 等原创算法,并兼容 Ray 分布式运行时、FSDP、LoRA 与全参数同步。适用于多模态大模型(如图文生成、视频生成、跨模态决策)的策略优化与对齐训练,尤其适合需在不同模型架构间复用 RL 流程的研究与工程场景。
Python
Other778
Stars
49
Forks
1
Watchers
13
Issues
Star 增长
今日0
近 7 天0
近 30 天+55
综合评分54.6
默认分支main