
MEDS
Linxi000
暂无描述
AI 简介
MEDS(Memory-Enhanced Dynamic Reward Shaping)是一种面向大语言模型强化学习训练的记忆增强型奖励塑形方法。它通过复用前向传播中的层级logits作为轻量级推理行为表征,对历史错误模式进行聚类,并对重复性失败施加更强惩罚,从而提升推理泛化性与采样多样性。项目基于veRL框架实现,支持与现有RLHF流程无缝集成。适用于需要提升LLM复杂推理鲁棒性、减少错误复现、增强探索能力的场景,如数学推理、代码生成和多步逻辑问答等任务的训练优化。
Python
Apache License 2.0143
Stars
1
Forks
3
Watchers
2
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分0.9
默认分支main