Ring-Zero: 将零强化学习扩展到万亿参数以实现涌现推理
零强化学习(zero RL) 凭借可验证奖励、无需人工标注数据,已成为激发链式思维推理的强大范式。然而受计算限制,现有研究主要局限于小模型,大规模下的训练动态与涌现能力尚待探索。 我们提出稳定高效的训练管线,集成裁剪重要性采样、训练-推理比例校正与混合精度控制等算法与系统优化,以在万亿参数规模激发高质量推理行为。实验发现:1) 扩展至 1T 参数显著提升样本效率与性能天花板;2) 训练过程依次经历初始发现阶段与精炼阶段;3) 模型自发涌现拟人化、结构化格式、自我验证、并行推理及上下文焦虑等高级认知行为,无需手工设计启发式规则。 在七个数学基准上,Ring-2.5-1T-Zero 取得有竞争力表现。我们进一步提出三维结构化评估框架(可理解性、可复现性与效率),证明模型在生成结构化、简洁推理链上的优势。分享所观察的涌现现象,旨在为社区尤其是万亿规模下的缩放行为提供深入见解。
论文精读
TL;DR Ring-Zero 将 Zero RL 稳定扩展至 1T 参数,发现模型自发涌现类人推理等高级认知行为,以事实验证规模定律的“惨痛教训”,并配套提出 CoT 质量多维度评估框架。
问题
问题背景
零强化学习(zero RL)借助可验证奖励无需人工标注即可激发语言模型的思维链推理(CoT),已成为高效提升推理能力的前沿范式。然而,现有工作多局限于十亿参数级小模型,大规模训练的动态与涌现行为尚为空白。
现有方法局限
将 PPO、GRPO 等算法直接扩展至大模型时,会遭遇三大技术瓶颈:
- 可读性退化:生成文本充斥重复片段与无意义 token,导致推理过程难以解析;
- 推理深度僵化:模型无法按问题复杂度自适应调节推理步数,长序列中 token 冗余严重;
- 训练失控:奖励方差与策略偏移被急剧放大,易引发梯度动荡、崩溃或模式坍塌。 朴素增大模型规模反而会放大上述缺陷,无法自然获得高质量推理。
为什么这个问题难/重要
核心难点在于万亿参数空间下同时保证探索效率、训练稳定性与输出精炼——这三者在大尺度下相互拮抗。业界反复验证的“bitter lesson”表明,算力驱动的通用方法终将胜出,但在推理增强领域,如何构建不依赖人工启发式的稳定训练管线,避免浪费大量计算在无效生成上,是迈向工业级应用的关键卡点。此外,混合精度控制、并行策略等系统工程瓶颈进一步抬高了准入门槛。
行业类比
类似自动驾驶感知模型从仿真小模型迁移到真实道路大模型时面临的“规模断层”,zero RL 推理的 scale-up 也需要跨越从“能推理”到“稳定、高效自适应推理”的工程鸿沟。
核心洞察
- 万亿参数规模的 Zero RL 训练揭示了缩放的核心价值:不仅性能天花板显著提升,样本效率也得到改善,且训练过程自发涌现出结构化推理、自我验证等高级认知行为,使得手工设计的启发式方法变得多余。这与以往限于小模型的 Zero RL 工作形成鲜明对比,之前研究未能观察到规模带来的训练动态突变和认知涌现,因此本工作验证了“痛苦教训”在大规模推理训练中的适用性。
- 论文识别出 Naive Scaling 会导致可读性差、token 冗余和推理深度不自适应等问题,进而提出包含 Clipped Importance Sampling、训练推理比校正与混合精度控制的稳定训练流水线。这一工程优化方案区别于现有工作仅聚焦算法设计,从系统层面解决了万亿参数 RL 训练中极易出现的坍塌和振荡问题,为后续超大规模强化学习提供了可复用的基础设施参考。
- 该工作不仅评估最终答案正确率,还提出从 Comprehensibility、Reproducibility 和 Efficiency 三个维度结构化衡量 CoT 质量,克服了现有评测过于单一的问题。实验表明,大规模 Zero RL 模型在保证正确性的同时能生成更结构化、更简洁的推理轨迹,这对于实际部署中推理成本和可解释性需求至关重要,也为 CoT 质量评测建立了更全面的基线框架。
方法
输入
模型以大规模预训练语言模型(up to 1T 参数)为起点,无需人工标注的推理数据。奖励信号仅来自可验证任务(如数学答案正确性),构成 Zero RL 设定。
关键训练模块
Ring-Zero 通过四阶段渐进式管线解决直接扩展带来的可读性差、标记冗余与推理深度固定等问题:
- 第一阶段 RL(Reasoning Elicitation) :使用标准 RLVR(如策略梯度)激发链式思维推理能力,此阶段模型倾向生成冗长但正确率不稳定的推理链。
- 自蒸馏(Self Distillation) :将第一阶段的高质量但冗长的推理轨迹压缩为更精炼版本,并用于监督微调,作为后续 RL 的稳定起点,平衡推理能力与效率。
- 第二阶段 RL(Sustained Optimization) :在蒸馏后模型上继续进行 RL 优化,巩固推理正确率与格式。
- 第三阶段 RL(Adaptive Reasoning Depth) :引入自适应推理深度信号,促使模型根据问题复杂度动态调整思考步数,避免过度或不足思考。
为支撑万亿参数训练,引入多项基础设施优化:
- 重要性采样裁剪(Clipped Importance Sampling) :限制策略更新幅度,防止训练崩溃。
- 训练-推理比例校正(Training-Inference Ratio Correction) :对齐采样分布,减少分布漂移。
- 混合精度控制(Mixed-precision Control) :结合 FP16/BF16 降低显存占用。
- 上下文并行(Context Parallelism) :优化超长序列注意力计算,提升吞吐。
输出
最终模型能生成结构化、简洁且可复现的推理轨迹,并涌现出拟人化思考、自我验证、平行推理等高级认知行为,无需手工启发式规则。
与多数局限于小模型且依赖手工奖励塑形的 Zero RL 工作不同,Ring-Zero 通过多阶段训练与系统优化首次在万亿参数规模证明:纯 RL 驱动的 CoT 随规模自涌现,稳定且高效。
实验
实验设计
Ring-Zero 采用多阶段 RL 训练流程:第一阶 RL 激发推理行为;随后进行 自蒸馏 压缩并稳定模型;第二阶 RL 持续优化;第三阶 RL 实现自适应推理深度。基础设施层面引入混合精度控制、上下文并行优化等系统优化。评估覆盖七个数学基准,并辅以 CoT 质量三维评价框架(可理解性、可复现性、效率)。
关键发现
- 样本效率与性能天花板提升:扩展至 1T 参数显著提高 RL 训练的样本效率,性能上限远超小模型。
- 训练阶段序贯演化:训练过程先经历“发现阶段”(模型初步学会推理),后进入“锐化阶段”(深度优化推理策略)。
- 涌现高级认知行为:模型自发产生 拟人化推理轨迹、结构化格式、并行推理、自我验证、上下文焦虑 等现象,使人工设计的启发式策略变得冗余。这验证了规模化带来的“苦涩教训”。
与基线对比
虽然论文未列出具体分数的对比,但指出 Ring-2.5-1T-Zero 在数学基准上取得了有竞争力的表现。更重要的是,在 CoT 质量评估上,该模型产生的推理链更具结构化、简洁性,相较于依赖人工启发式或小规模训练的方法,展现出更强的自主进化能力。大规模 RL 训练的涌现特性(如自适应推理深度)是单纯蒸馏或小规模 RL 难以复现的。
行业影响
落地场景
万亿参数 Zero RL 模型的核心价值在于不依赖人类标注数据的复杂推理能力涌现,尤其适合需要长步骤、结构化思维链的场景。典型应用包括:
- 智能教育辅导:数学、编程类产品的解题过程生成与自我验证,自动给出分步解析,提升学习交互深度。
- 金融分析与决策:财报解读、风险评估、合规推理,需可审计、可复现的推理链条,Ring‑Zero 的结构化格式与自我验证直接增强可信度。
- 科研与开发辅助:代码生成与调试、科学文献中的逻辑推导,并行推理和自适应推理深度可大幅提升复杂任务处理效率。
商业价值
- 成本端:零人类标注 RL 免去大规模人工指令构建与筛选,显著降低数据获取与清洗成本;训练流程中的混合精度控制与训练‑推理比率校正提高硬件利用率,降低千卡级集群的训练预算超支风险。
- 收入与体验端:涌现的拟人化推理痕迹和上下文焦虑可主动请求澄清,减少用户反复输入,提升对话式产品的任务完成率和留存;简洁高效的推理轨迹直接降低 API 调用成本,支撑更高频次的商业调用。
与现有产品 / 工作流的集成
- 作为推理引擎:通过标准 LLM 推理服务框架(如 vLLM、TGI)部署,对外暴露 Chat API,与现有对话式产品(客服、企业知识库、低代码平台)无缝对接。
- 训练流水线借鉴:Clipped Importance Sampling 等稳定化机制可直接移植到其他大模型强化学习训练框架(如 Ray + PyTorch FSDP),提升已有 RLHF/RLVR 流程的收敛稳定性。
- 评估体系补充:提出的 CoT 质量三维度(可理解性、可复现性、效率) 可作为产品选型与迭代的自动化评估标准,降低人工评测成本。
具体落地场景举例:
- 电商智能客服:面对退换货、优惠计算等复杂规则场景,模型可生成带自我检查的推理链,并主动询问缺失信息(上下文焦虑),减少转人工率。
- 自动驾驶仿真测试:利用并行推理快速验证多种交通场景下的决策逻辑,生成可解释的安全分析报告,辅助开发迭代。
局限
- **领域局限性**:论文仅在数学推理基准上验证(七个数据集),未拓展至代码生成、科学问答等更广泛的推理域。虽然涌现的自我验证、并行推理等现象理论上可迁移,但缺少跨领域实证,模型的泛化边界仍不清晰。
- **成本与可复现性**:训练 1T 参数模型并执行多阶段 zero RL 需要极大算力,文中提出的 mixed-precision 等优化仍依赖数千 GPU 的集群,普通研究团队难以复现。这限制了方法的快速迭代与社区验证,也使得不同规模配置下的对比实验不够充分。
- **涌现行为稳定性**:模型自发产生的拟人化、上下文焦虑等行为虽有趣,但论文未系统分析其触发条件、对提示的敏感性以及在不同随机种子下的一致性。实际部署时,这些非预期行为可能引入推理偏差或不可控风险,需进一步评估其鲁棒性。