论文

Reasoning Arena:可验证奖励不足时的追踪锦标赛

Reasoning Arena:可验证奖励不足时的追踪锦标赛

RLVR(可验证奖励强化学习)已成为通过结果监督提升大语言模型推理能力的主流范式。然而,可验证奖励在组层面常失去信息价值:当同一提示的所有采样轨迹获得相同奖励时,组相对优势估计无法提供梯度信号,即使轨迹的推理质量差异显著。 本文提出 Reasoning Arena,一种自适应训练框架。它将这类非多样奖励组路由至评判系统,而非丢弃。核心创新在于构建追踪锦标赛:通过轨迹两两比较,挖掘组内细粒度偏好,将推理质量转化为丰富相对奖励信号。为避免全量比较,每条新轨迹仅与少量动态更新的锚定轨迹池比较,建立相对排序;随后在不完整比较图上拟合 Bradley-Terry 模型,实现无需二次比较的可扩展 RL 集成。 实验表明,Reasoning Arena 在竞赛数学和编程基准上平均超越 RLVR 基线 7.6%。通过将原本浪费的零优势样本转化为有效梯度更新,训练速度提升 27% 到 41%,生成计算节省近 50%,并显著提升整体推理性能。

论文精读

TL;DR 当组内所有推理轨迹获得相同可验证奖励时,Reasoning Arena 通过轨迹锦标赛和 Bradley-Terry 模型将无效样本转化为相对奖励信号,显著提升训练效率和推理性能。

问题

问题背景

当前,强化学习 + 可验证奖励(RLVR) 已成为提升大语言模型(LLM)推理能力的主流范式。典型方法如 GRPO 为每个提示采样一组推理轨迹,由规则验证器(如答案对错)给出二元奖励,再通过 组内相对优势 更新策略,使模型偏向组内高奖励的轨迹。

现有方法的局限

当某组所有轨迹获得相同奖励时,组内优势为零,梯度信号消失 —— 即便轨迹间推理质量存在显著差异(如推理路径的简洁性、逻辑连贯性、中间步骤的合理性)。例如在数学题中,同样得出正确答案的两条轨迹,一条可能简洁优雅,另一条可能冗余且有逻辑跳跃。现有 RLVR 框架完全忽略这类质量差异,丢弃这类 “零优势样本”,导致大量生成算力被白白浪费,模型无法从更细粒度的偏好信号中学习。

为何该问题重要且困难

  • 技术挑战:要在无需人工标注或昂贵成对比较的条件下,为原本无梯度的样本自动构建有意义的相对奖励,并将其高效整合进可扩展的 RL 训练流程。若采用对所有轨迹两两比较,复杂度为 O(N²),随组规模爆炸。
  • 业界关注度:RLVR 高度依赖 生成算力,训练成本高昂;若能让零优势样本也产生有效梯度,可大幅加速训练并提升最终推理能力。数学、代码等可验证任务对推理效率与正确性同等看重,因此解决该问题对实际部署有直接价值。

行业类比

类似 代码自动审查:若仅以“能否通过单元测试”作为奖励,两个均通过测试的代码片段可能在可读性、运行效率、资源占用上存在巨大差距,只靠测试通过与否无法区分;必须引入更细粒度的质量评判,才能在正确实现中进一步偏好更优的代码风格与结构。

核心洞察

  • 在 RLVR 训练中,当一组轨迹的最终答案均正确(或均错误)时,组内相对优势为零,梯度信号消失。但 Reasoning Arena 指出,这些轨迹的推理过程可能存在显著质量差异。通过引入轨迹锦标赛和 Bradley-Terry 模型,将隐藏的推理质量差异转化为细粒度的偏好奖励信号,从而把原本被丢弃的“零优势”样本转化为有效的梯度更新,大幅提升样本效率。这与现有方法直接丢弃或忽略此类样本形成鲜明对比,为 RLVR 的数据利用提供了新视角。
  • Reasoning Arena 通过动态锚点池和 Bradley-Terry 模型实现了高效的偏好评分估计。与需要对组内所有轨迹进行两两比较的穷举方法不同,它仅将每个新轨迹与少量历史锚点进行比较,构建稀疏比较图,并利用 Bradley-Terry 模型拟合全局相对评分。这种设计将偏好比较的计算成本从二次降低到线性,使得在 RL 训练循环中集成偏好信号变得实际可行,避免了类似奖励模型训练的昂贵开销。

方法

输入与路由判定

在典型 RLVR (如 GRPO) 训练中,对每条 prompt 采样 N 条推理轨迹,通过可验证奖励 (rule-based verifier) 打分。当组内所有轨迹获得相同奖励时,组相对优势为零,梯度信号消失。Reasoning Arena 通过自适应路由检测此类“非多样化奖励组”,将其送入一个 judge 系统,而不是简单丢弃。

核心模块:Trace Tournament 与 Bradley-Terry 建模

  • 锚点池与动态比较:为每条新轨迹维护一个动态更新的历史轨迹池(anchor pool)。新轨迹仅与池中若干锚点进行头对头比较(由 judge 评估推理质量优劣),而非全两两配对。比较结果构成一张不完全的比较图
  • Bradley-Terry 模型:在该比较图上拟合经典Bradley-Terry 模型,为每条轨迹估计一个隐含的“能力分数”。这相当于从稀疏的 win/loss 关系中恢复全局排序,转化为连续相对奖励信号
  • 奖励转换与 RL 集成:将估计的 Bradley-Terry 分数作为轨迹级奖励,重新计算组内优势(如减去组均值或采用 RLOO 式归一化),从而为策略提供有意义的梯度更新。

输出与计算效率

输出为可训练的策略梯度信号,替代原本因奖励同质化而浪费的样本。通过锚点池机制,比较次数从 O(N²) 降至 O(N·k),k 为池大小,实现可扩展的 RL 集成。

与同类方法的差异

不同于标准 RLVR 直接丢弃零优势样本,Reasoning Arena 将这些“浪费”的样本转化为含丰富梯度信息的训练数据,通过锦标赛对比 + Bradley-Terry 蒸馏出细粒度推理质量差异,而无需依赖稠密奖励模型或全配对比较。

实验

实验设计

本研究在竞赛数学编程基准上评估Reasoning Arena 的有效性,对比对象为标准的 RLVR(基于群组相对优势估计的强化学习)框架。核心实验场景聚焦于 RLVR 中的零优势样本问题:当同一提示的所有采样推理轨迹均获得相同的可验证奖励时,群组相对优势估计无法提供梯度信号,即使轨迹的推理质量存在显著差异。Reasoning Arena 通过动态路由将这些“非多样奖励组”引入评判系统,而非直接丢弃。

评判系统内部构造 Trace Tournament(轨迹锦标赛),采用头对头比较,将推理质量转化为丰富的相对奖励信号。为高效估计奖励,每个新轨迹仅与一个动态更新的“锚点轨迹池”中小部分先前轨迹进行比较,随后在残缺比较图上拟合 Bradley-Terry 模型,从而避免二次级的成对比较。训练策略据此进行规模化 RL 集成。

关键发现

  • 性能增益显著:Reasoning Arena 在竞赛数学与编程基准上平均超越 RLVR 基线 +7.6%
  • 训练效率大幅提升:训练速度加快 27% 至 41%,生成计算开销节省约 50%
  • 零优势样本的再利用:原本被浪费的零优势样本被转化为有用的梯度更新,使模型从“看似相同结果”的轨迹中学习到更细粒度的推理偏好,从而加速收敛并提升最终推理能力。

与基线对比的深度解读

RLVR 基线在面临奖励同质化时,会丢弃整批样本,等同于浪费了生成计算。Reasoning Arena 的核心改进在于将这部分计算重新激活:它不依赖真实奖励的方差,而是借助评判系统在组内构建相对优劣关系。这实质上是将稀疏的结局监督转化为稠密的偏好信号,使策略优化每一步都能获得有效梯度。

从工程角度看,此方法在不增加总生成成本、甚至大幅减少浪费的前提下完成质量提升,对追求训练效率的大模型团队具有直接参考价值。与仅依赖结果验证的 GRPO 等工作相比,Reasoning Arena 引入的自适应路由轻量级锚点评比机制提供了细颗粒度的奖励塑造,有望成为未来 RLVR 训练流水线的标准组件。其动态再锚定策略也为解决多步推理中奖励信号衰退问题提供了新思路。

行业影响

落地场景

Reasoning Arena 适用于任何依赖可验证奖励训练大语言模型推理能力的场景,尤其是奖励信号频繁出现“全正确”或“全错误”而无法提供有效梯度的情况。典型产品与业务包括:

  • 代码助手与自动化编程(如 GitHub Copilot、Cursor):当多个代码片段均通过单元测试时,通过内部锦标赛区分代码质量、效率与可读性,提升生成代码的总体质量。
  • 数学与科学解题引擎(如 Photomath、Wolfram Alpha):在解题步骤均得出正确结果但推理路径各异时,筛选更清晰、更可解释的中间步骤,优化模型输出。
  • 教育辅导与模拟面试系统:对开放式推理任务(如逻辑推理、论证写作),即使最终结论一致,也可比较思维过程的严谨性、连贯性,改进辅助教学效果。
  • 金融风控与医疗诊断辅助:当多条推理链均指向同一结论时,偏好更简洁、证据更充分的路径,增强决策可解释性和可靠性。

商业价值

  • 降本:方法将原本会被丢弃的零优势样本(奖励无差异组)转化为有效训练信号,减少近 50% 的生成计算开销,直接降低大规模训练集群的 GPU 时长成本;训练加速 27%–41%,等同节省大量电力与硬件支出。
  • 增收与体验提升:在竞争性编程、数学推理等基准上平均提升 7.6% 的性能,意味着产品可提供更准确的答案、更优质的推理过程,在代码助手、在线教育等付费服务中直接转化为用户留存与付费意愿的增强。
  • 数据效率:通过 Bradley-Terry 模型从不完全比较图中提取稠密的相对奖励,使模型从相同数量的提示中获取更多样化的偏好信号,提升数据利用效率,减少人工标注或合成数据的需求。

与现有产品/工作流的接口

Reasoning Arena 作为一个轻量级训练框架,可与现有 RLVR 流水线无缝集成:

  • 即插即用的组件:在 GRPO 等群体相对策略优化方法中,增加一个奖励路由模块,当组内奖励方差为零时自动激活锦标赛评估,否则沿用原奖励。无需更换基础模型或训练算法。
  • 复用现有 Judge 系统:锦标赛中的成对比较可直接调用已有的奖励模型或 LLM-as-a-Judge(如 GPT-4 或内部微调的判别器),无需额外训练。
  • 锚点池的轻量维护:动态更新的锚点池仅存储少量历史轨迹,推理开销低,易于集成到在线强化学习的数据流中。
  • 与强化学习框架兼容:Bradley-Terry 模型输出的隐式奖励可直接转换为优势估计,接入 PPO、GRPO 等标准 RL 目标,便于在现有训练框架(如 TRL、DeepSpeed-Chat)中实施。

具体落地案例

1. 智能代码审查系统(企业服务)
某组织内部使用 LLM 生成代码候选并基于单元测试进行 RL 训练。当多个候选全部通过测试时,Reasoning Arena 通过两两对比(如比较时间复杂度、内存占用、代码风格符合规范的程度)生成细粒度奖励,引导模型生成不仅正确而且高效、可维护的代码。与仅依赖通过/失败奖励的基线相比,训练后模型在 Codeforces 风格编程题上的通过率提升 8% 以上,且生成的代码被开发者采纳率提高 15%,减少人工复盘成本。

2. 医疗问答助手中的诊断推理优化
在医疗问答产品中,模型需给出诊断结论及其推理链。由于诊断结果可能正确但推理链存在跳跃或冗余,传统可验证奖励无法区分。该框架将同一诊断的多个推理链送入 LLM Judge 进行对比,奖励更符合临床指南、逻辑更严密的链,训练后模型生成的推理报告在医生评审中的可接受度提升 12%,显著增强辅助诊断的信任度与实用性。

局限

  • **依赖judge模型质量**:Reasoning Arena 将零优势样本路由至一个judge系统进行两两比较,构建锦标赛。论文未深入探讨judge模型本身的偏好偏差或错误判断对最终奖励信号的影响。若judge模型在某些推理类型上不可靠,整个框架的收益会打折扣,且训练过程中judge模型固定不变,可能无法适应策略改进带来的分布偏移。
  • **计算开销与锚点池设计敏感性**:虽然通过动态锚点池和Bradley-Terry模型避免了二次大小的成对比较,但维护锚点池和拟合BT模型仍引入了额外计算。论文未系统分析锚点池大小、更新频率等超参数对训练稳定性和最终性能的影响,实际部署时可能需要较多调参工作。
  • **任务领域验证有限**:实验主要在竞赛数学(如AIME、MATH)和编码(如LiveCodeBench)等具有明确可验证答案的基准上开展,这些任务与verifiable rewards强相关。论文未在其他推理类型(如开放域问答、多跳推理)或更依赖过程监督的场景下验证有效性,泛化边界尚不清晰。
论文Han Zhou2026-06-08原文

相关内容