ALEX-nlp

DenoiseRL

ALEX-nlp

DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes

AI 简介

DenoiseRL 是一个面向推理模型错误恢复的强化学习框架,旨在使模型在接收到由弱模型生成的错误前缀(noisy prefixes)时,仍能修正错误并输出正确答案。其核心技术是将推理过程建模为去噪任务:策略模型以被截断或错误的推理前缀为输入,通过可验证奖励(verifiable-reward RL)优化,主动修正中间状态并恢复完整正确解路径;无需强教师模型监督或人工构造困难样本。适用于大语言模型推理鲁棒性增强、弱监督条件下的推理微调、以及需在不完美中间输出上持续纠错的实际部署场景,如数学推理、逻辑问答与代码生成中的错误传播抑制。

Python
36
Stars
4
Forks
31
Watchers
1
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分2.1
默认分支main