YinqiBai962

D-ARL

YinqiBai962

暂无描述

AI 简介

D-ARL 是一个面向大语言模型推理后训练的分布匹配异步强化学习框架,旨在解决异步RL中因行为策略滞后导致的策略-数据分布不匹配问题。其核心功能包括:基于最近K个行为策略构建多源回放缓冲区、依据策略分布相似性进行方差引导的样本筛选、以及支持多行为策略联合优化的训练目标。技术上依托verl框架,兼容GRPO/PPO等主流LLM对齐算法,兼顾训练效率与稳定性。适用于需要高吞吐、低延迟的大规模语言模型强化学习后训练场景,如智能体推理优化、对话策略微调等。

Python
Apache License 2.0
71
Stars
1
Forks
1
Watchers
2
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分37.9
默认分支main