
EffOPD
caiyuchen-ustc
Repository for EffOPD. We are working on polishing the details.
AI 简介
EffOPD 是一种面向大语言模型强化学习训练的高效在线策略蒸馏(On-Policy Distillation)方法,旨在提升策略优化过程中的参数外推效率与验证速度。其核心通过迭代式轻量验证机制(iterative test)、指数级检查点采样及基于 FSDP/Ray 的分布式训练架构实现;支持在少量验证样本(Parquet 格式)上快速评估候选参数,显著降低传统 OPD 的计算开销。适用于需要高频策略验证的大模型 RLHF、偏好建模与对齐训练等场景,尤其适合算力受限但需保持训练稳定性的研究与工程环境。
Python
70
Stars
2
Forks
44
Watchers
0
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分38.43
默认分支main