Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

2026年07月08日
  • 简介
    强化学习(RL)在大语言模型(LLM)的后训练阶段正变得日益重要。此前,面向LLM的强化学习流程大多采用同步式、批内交错(batch-interleaved)架构,这种设计在处理长程智能体任务(long-horizon agentic tasks)时效率低下。近期,异步强化学习作为一种更高效的替代方案崭露头角——它可在 rollout(轨迹采样)陆续到达时即时更新模型参数。然而,当前主流的异步RL系统往往过度侧重吞吐量(throughput),而对训练稳定性与任务有效性等关键问题却鲜有深入探索。例如,一个突出挑战在于:当前广泛应用的GRPO框架所依赖的“按组采样”(group-wise sampling)机制,天然难以适配异步智能体训练范式。 本文提出“单轨迹异步优化”(Single-rollout Asynchronous Optimization, SAO),以系统性应对异步强化学习中的稳定性与离策略(off-policy)难题。为削弱离策略偏差、提升泛化能力,我们摒弃按组采样,转而采用“单轨迹采样”(single-rollout sampling)策略,即每个提示(prompt)仅对应一条独立 rollout。在此基础上,我们进一步融合若干经过实践验证的价值模型(value model)训练设计,以增强该单轨迹策略的实际效果。为提升优化过程的稳定性,我们引入一种严格的双向词元级裁剪(strict double-side token-level clipping)机制。 SAO可实现长达一千步的稳定训练,并在智能体编程与推理基准测试(如SWE-Bench Verified、BeyondAIME及IMOAnswerBench)上持续超越GRPO及其各类变体。我们还证明,单轨迹强化学习在模拟的在线学习场景中尤为有效——在此类场景中,模型需持续适应动态演化的环境。正因如此,SAO已成功部署于开源大模型GLM-5.2(750B参数规模,运行于40块A100 GPU集群)的智能体强化学习训练流水线中。
  • 作者讲解·1
  • 图表
  • 解决问题
    现有大语言模型(LLM)的强化学习(RL)后训练 pipeline 多为同步、批处理式,难以高效支持长程智能体(agentic)任务;而新兴的异步 RL 虽提升吞吐,却忽视训练稳定性与任务有效性——尤其在 GRPO 等主流框架中,group-wise 采样与异步 rollout 到达的时序不一致导致严重 off-policy 偏差和优化震荡。该问题在 agentic 编程与推理等高难度、长决策链任务中尤为突出,是一个尚未被系统解决的新挑战。
  • 关键思路
    提出 Single-rollout Asynchronous Optimization (SAO):摒弃 GRPO 的 group-wise 采样,改为每个 prompt 仅使用单条 rollout(single-rollout sampling),从根本上缓解异步 setting 下的 off-policy 问题;引入 token-level 双侧严格裁剪(strict double-side token-level clipping)增强梯度稳定性;并结合实用化价值模型训练设计(如 rollout-aware value head 初始化与延迟更新),实现高稳定、高泛化的异步 RL 优化。
  • 其它亮点
    SAO 在 SWE-Bench Verified(真实软件工程修复)、BeyondAIME(高级数学推理)、IMOAnswerBench(国际奥赛级数学证明)上全面超越 GRPO 及其变体;支持千步稳定训练(远超同类方法通常 <200 步的收敛极限);首次验证 single-rollout RL 在模拟在线学习(evolving environment)中的强适应性;已成功部署于开源超大规模模型 GLM-5.2(750B 参数,运行于 40×A100 集群)的 agentic RL 训练 pipeline;论文未开源代码,但提供了完整训练配置与超参细节。
  • 相关研究
    GRPO: Group Relative Policy Optimization for LLM Alignment (ICML 2024); PPO-LLM: Scalable Reinforcement Learning for Large Language Models (NeurIPS 2023); DPO: Direct Preference Optimization (ICML 2023); ORPO: Online Reinforcement Learning with Preference Optimization (ACL 2024); AsyncPPO: Asynchronous Proximal Policy Optimization for LLMs (arXiv 2024)
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问