LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts

2026年07月30日
  • 简介
    基于可验证奖励的强化学习(RLVR)在数学推理任务中存在一个结构性盲区:对于“悬崖型”提示(即一组采样轨迹全部失败的提示),经组归一化后的优势函数恒为零,因此GRPO算法恰好无法在模型能力边界处的这些提示上产生任何梯度。为此,我们提出低秩适配器支撑策略优化(LoRA Scaffolded Policy Optimization, LSPO),一种在采样阶段即可恢复该缺失梯度的机制。在每个强化学习步中,LSPO首先识别出“悬崖型”提示,随后通过一个简短的监督微调步骤,利用其标准答案拟合一个轻量级低秩适配器(LoRA);接着,使用“基础模型+适配器”的组合对这些悬崖提示重新采样生成新轨迹;再将其中成功完成的样本,经重要性采样校正后拼接回原始强化学习批次中;最后,仅对基础模型执行一次GRPO更新——而适配器仅接收监督学习梯度,并在保存检查点时被丢弃,最终所得仍为纯基础模型。在DeepMath-103K数据集上,以DeepSeek-R1-Distill-Qwen-1.5B为基座模型,我们在每组实验中采用n=5组成对随机种子、并在统一的1000步评估周期下进行评测。结果显示:LSPO在全部16个(基准数据集,pass@k)评测单元上的5种子均值,均达到或超越DAPO基线方法(其中15项严格胜出,1项完全持平);具体提升幅度包括:AIME24/pass@4达+10.7分,AIME24与AIME26在pass@16上各提升+6.7分,MATH500/pass@1提升+2.4分;在全部16个评测单元上的平均提升为+3.8分。
  • 作者讲解
  • 图表
  • 解决问题
    在基于可验证奖励的强化学习(RLVR)用于数学推理时,存在结构性盲点:当遇到'悬崖提示'(cliff prompts)——即一组采样轨迹全部失败、无法获得任何正奖励的提示——组归一化优势函数恒为零,导致GRPO等策略优化方法在这些能力边界处完全丧失梯度,无法更新模型。这是一个被忽视但关键的训练动态缺陷,尤其影响模型向更高难度问题泛化的能力。
  • 关键思路
    提出LoRA Scaffolded Policy Optimization(LSPO):一种采样时动态干预机制。在每个RL步中,自动识别悬崖提示,用极轻量级LoRA适配器在真实解上做短暂监督微调(仅数步),以该适配器增强基础模型重采样出成功轨迹,再通过重要性采样校正后融入原始RL批次;最终仅对基础模型执行GRPO更新,而LoRA适配器仅接收监督梯度且在检查点丢弃——实现‘梯度恢复’而不引入额外参数或部署开销。其新意在于将监督学习作为RL的临时 scaffolding 工具,而非替代或混合目标,严格保持单阶段、基础模型-only 的输出与部署一致性。
  • 其它亮点
    实验严谨:在DeepMath-103K基准上,使用DeepSeek-R1-Distill-Qwen-1.5B模型,n=5配对种子、1000步固定训练预算下,LSPO在全部16个(benchmark, pass@k)指标上均不劣于DAPO基线(15胜1平),最大提升达+10.7(AIME24/pass@4);平均提升+3.8分;论文未提及开源代码,但方法设计高度模块化、兼容现有RLVR流水线;值得深入的方向包括:悬崖提示的早期预测机制、LoRA scaffold 的自适应秩/步数调度、以及在形式化证明生成等更严苛验证场景中的泛化验证。
  • 相关研究
    Reinforcement Learning from Verifiable Rewards (RLVR); Direct Preference Optimization (DPO) and its variants like DAPO; Group Relative Policy Optimization (GRPO); Low-Rank Adaptation (LoRA) for efficient fine-tuning; 'Cliff Problem' analysis in RL-based theorem proving (e.g., 'The Cliff Edge of Reward Modeling', ICLR 2024 Workshop); Self-Play with Verification in Mathematical Reasoning (e.g., 'LeanDojo + RL', NeurIPS 2023).
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问