Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

2026年07月14日
  • 简介
    无需人类标注数据、仅依靠可验证奖励进行强化学习的方法(常被称为“零样本强化学习”或“Zero RL”),已成为激发模型链式思维(Chain-of-Thought, CoT)推理能力的一种强大范式。然而,受限于计算资源,现有研究大多仅在小型模型上开展,导致大规模模型下的训练动力学特征与涌现能力仍属未知领域。为切实探索这一前沿方向,我们致力于从模型中激发高质量的推理行为。但我们发现,简单粗暴地扩大模型规模往往会导致生成内容可读性差、存在大量冗余词元(token),且推理深度缺乏自适应调节能力。为应对上述挑战,我们提出了一套稳定而高效的训练流程,其中融合了多项算法与系统级优化技术,包括截断重要性采样(clipped importance sampling)、训练-推理比例校正(training-inference ratio correction)以及混合精度控制(mixed-precision control)。我们的实验揭示了三条关键结论,有力印证了关于“缩放之苦涩教训”(the “bitter lesson” of scaling)的核心观点:(1)将模型参数量扩展至1万亿(1T)级别,可显著提升样本利用效率与性能上限;(2)整个训练过程呈现出清晰的阶段性演进规律——先经历一个初步发现阶段(discovery phase),再进入一个精细化打磨阶段(sharpening phase);(3)模型在训练过程中自发涌现出一系列高级认知行为,包括拟人化倾向(anthropomorphism)、结构化输出格式(structured formatting)、自我验证能力(self-verification)、并行推理能力(parallel reasoning)以及上下文焦虑现象(context anxiety),从而使人工设计的启发式规则变得不再必要。在七个数学推理基准测试集上的评估结果表明,Ring-2.5-1T-Zero模型展现出具有竞争力的整体性能。此外,为超越单纯以最终答案是否正确作为评判标准的传统做法,我们进一步构建了一个涵盖三个维度的结构化链式思维质量评估框架——即**可理解性**(comprehensibility)、**可复现性**(reproducibility)与**推理效率**(efficiency);在此框架下,我们的模型在生成结构清晰、简洁凝练的推理路径方面展现出明显优势。通过公开分享我们在1万亿参数尺度上所观察到的各类涌现现象,我们期望为研究社区提供更深层次的洞见,助力深入理解超大规模模型的缩放行为及其内在规律。
  • 作者讲解
  • 解决问题
    论文旨在探索超大规模(1T参数)下零标注强化学习(Zero RL)在链式推理(Chain-of-Thought, CoT)中的可行性与涌现规律,解决现有零RL研究受限于小模型规模、难以揭示大模型训练动态与高级认知能力涌现机制的问题;该问题在1T尺度上属首次系统性实证探索,具有显著新颖性。
  • 关键思路
    提出稳定高效的零RL训练管线,核心创新包括:(1)算法层面引入clipped importance sampling与training-inference ratio correction以缓解策略梯度方差和分布偏移;(2)系统层面采用混合精度控制实现1T模型的可行训练;(3)摒弃人工设计的CoT模板或监督信号,完全依赖可验证奖励(如数学推导自洽性)驱动模型自发演化出结构化推理能力。
  • 其它亮点
    实验覆盖7个数学推理基准(如MATH、AMPS、GSM8K等),首次在1T参数规模实现Zero RL端到端训练;提出三维CoT质量评估框架(comprehensibility/reproducibility/efficiency),超越传统答案准确率指标;观察并命名多种自发涌现的认知现象(anthropomorphism, self-verification, context anxiety等),未依赖任何人类标注或规则注入;代码与评估框架计划开源(文中提及‘sharing observed phenomena’,但暂未发布);值得深入的方向包括:涌现行为的可解释性建模、零RL中奖励函数的泛化边界、以及1T级训练的能耗-性能权衡。
  • 相关研究
    DeepMind's 'Solving Math Word Problems with Chain-of-Thought' (2022); OpenAI's 'Training Verifiers to Check Reasoning' (2023); Anthropic's 'Constitutional AI: Harmlessness from Self-Critique' (2023); Google Research's 'Zero-Shot Reinforcement Learning via Reward Modeling' (2024); Meta's 'Scaling Laws for Reward Modeling and RLHF' (2023)
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问