
RLCSD
THU-BPM
Source code of paper "RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation"
AI 简介
RLCSD 是一种面向大语言模型推理优化的强化学习方法,提出对比式在线策略自蒸馏机制以缓解特权提示引发的风格漂移问题。其核心通过在相同提示模板下对比正确与错误参考解所诱导的教师分布差异,提取聚焦于任务关键token的对比信号,并将其作为验证器锚定的调制项融入GRPO优势函数,实现更稳定、更有效的token级监督。该方法适用于数学推理、逻辑谜题等需要长链严谨推理的场景,在Qwen3和Olmo-3系列模型上显著提升DeepMath与Knights & Knaves等基准表现。
Python
MIT License69
Stars
3
Forks
2
Watchers
2
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分41.81
默认分支main