- 简介本文提出了一种针对大语言模型的强化学习(RL)新框架,解释了在何种条件下,策略梯度方法(如REINFORCE)可以通过代理的词元级别目标来优化真实的序列级别奖励。具体而言,通过一阶近似分析,我们发现只有当训练与推理之间的差异以及策略陈旧性均被最小化时,该代理目标才变得越来越有效。这一洞察为若干广泛采用的技术在稳定强化学习训练中的关键作用提供了理论依据,包括重要性采样校正、裁剪(clipping),尤其是针对混合专家(MoE)模型的路由回放(Routing Replay)。通过对一个300亿参数的MoE模型开展大规模实验,累计使用数十万GPU小时,我们发现,在on-policy训练中,采用重要性采样校正的基本策略梯度算法能够实现最高的训练稳定性。当引入off-policy更新以加速收敛时,结合裁剪和路由回放对于缓解因策略陈旧性引发的不稳定性至关重要。值得注意的是,一旦训练过程趋于稳定,无论是否采用冷启动初始化,持续优化最终都能达到相近的性能水平。我们希望所分享的这些见解以及所总结出的稳定强化学习训练方案,能够推动未来的研究进展。
-
- 图表
- 解决问题该论文旨在解决在使用大规模语言模型进行强化学习(RL)时,如何有效优化序列级奖励的问题。传统方法通常依赖于token-level的代理目标函数,但这种替代是否合理以及在何种条件下成立尚不清晰。此外,训练与推理之间的差异以及策略陈旧性(policy staleness)导致的训练不稳定是当前RL with LLMs中的关键挑战。这是一个随着大模型兴起而变得尤为突出的新问题。
- 关键思路论文提出了一种新颖的理论框架,通过一阶近似证明:只有当训练-推理差异和策略陈旧性被最小化时,token-level的代理目标才能有效逼近真实的序列级奖励。这一洞察为重要性采样校正、PPO中的clipping机制以及专为MoE模型设计的Routing Replay等技术提供了理论依据——它们本质上是在不同层面缓解上述两种误差。相比现有工作仅从经验上使用这些技巧,本文首次给出了统一的原理性解释。
- 其它亮点作者在总耗数百千GPU小时的大规模实验中验证了理论预测,使用一个30B参数的MoE模型进行了on-policy与off-policy训练对比。结果显示:基础带重要性采样的REINFORCE算法在on-policy设置下最稳定;而在引入off-policy更新以加速收敛时,必须结合clipping和Routing Replay才能控制因策略陈旧带来的方差。值得注意的是,一旦训练稳定,无论是否冷启动,长期优化最终能达到相似性能水平。代码虽未明确提及开源,但其提出的稳定训练配方(recipe)对后续研究具有高度参考价值,尤其值得在更大规模模型或复杂任务中进一步验证。
- 1. Reinforcement Learning with Large Language Models: A Survey 2. Proximal Policy Optimization Algorithms 3. Deep Reinforcement Learning from Human Preferences 4. Mixture-of-Agents Enhances Large Language Model Capabilities 5. QLORA: Efficient Finetuning of Quantized LLMs via PPO


提问交流