论文

Agon:竞争性跨模型强化学习与隐式对手推理评分

Agon:竞争性跨模型强化学习与隐式对手推理评分

当前基于可验证奖励的强化学习(如 GRPO)仅对最终答案评分,导致模型在困难问题上倾向于生成更多内容而非更优推理,因为推理轨迹本身从未被评分,且不存在优质思考的标签。 为此,本文提出 Agon,该方法让两个竞争模型互为评分者。两个模型处理同一问题,交替扮演草稿者和审阅者:草稿者写出解决方案,审阅者在解题的同时阅读该方案;每个模型因比对方更优的解答而获得奖励。为了获胜,模型必须超越已看过自己工作的对手,从而在训练过程中隐式地评判推理质量,无需过程标签或奖励模型。由于两个模型同步优化,每个模型面对的对手不断增强,这是单模型强化学习无法实现的。两者只需实力相当且行为不同。推理时,模型按照训练方式部署为两阶段级联:一个模型起草,另一个阅读后作答。 在 DeepMath 困难子集上使用 Qwen3 基座,Agon 将 GRPO 的 pass@1 翻倍,提升幅度约为未训练的混合模型(Mixture-of-Agents)的八倍。该结果在竞赛编程代码中以及跨模型家族(Qwen3.5、Gemma 4)中均得到复现。当前模型以文本交互,下一步将让它们在隐空间中共同推理。

论文精读

TL;DR 通过让两个模型交替扮演起草者与挑战者,以“超过对手”的奖励信号隐式评判推理过程,无需过程标注,在困难数学题上将 GRPO 的 pass@1 提升一倍。

问题

问题背景

当前推理模型(如 DeepSeek-R1OpenAI o1)通过强化学习从可验证奖励(如数学题最终答案正确性)训练,性能大幅提升。但训练信号仅聚焦答案对错,推理过程本身缺乏直接评估,导致模型在难题上倾向于生成冗长但无效的推理链。

现有方法局限

主流算法 GRPO 等仅使用结果奖励,引发“长度病理”:模型在难题上生成更长的推理链以求碰巧答对,而非真正提升推理质量。由于无过程监督,推理链中大量的试错、循环或无关内容无法被惩罚,浪费计算资源且降低推断效率。此外,单模型自我对战受限于固定对手,难以提供持续递增的挑战;而显式训练奖励模型进行过程打分又面临高质量过程标签获取成本极高且主观的问题,数学推理的中间步骤正确性难以自动判定。

为什么这个问题难且重要

过程监督的缺失本质上是奖励稀疏与探索困难:模型必须在指数级大的文本空间中无导向地搜索有效推理,往往收敛到低质量的“猜测”策略。业界对推理模型的高效性和可靠性日益关注,无效长推理不仅消耗巨大的推理成本,还降低产品实用性。因此,迫切需要一种隐式的、可扩展的过程评估机制,无需昂贵的人工标注,又能自动适应模型能力的提升,持续提供有意义的推理反馈。

行业类比

就像在软件开发中仅通过最终产品是否通过测试来优化流程,而不审查中间设计和代码质量,长期会导致技术债积累和低效交付。

核心洞察

  • 竞争性训练实现隐式过程监督:Agon 让两个模型互为评审者,一个起草解答,另一个在阅读后作答,通过优胜奖励促使模型不仅生成正确答案,还要生成能超越对手的高质量推理。这解决了仅基于最终答案的 RL(如 GRPO)在难题上导致模型盲目增加长度而非提升推理质量的问题,因为推理过程被隐式地评判,无需任何过程标签或奖励模型。
  • 共同进化的对手提供自适应课程:两个模型同步优化,彼此成为不断增强的对手,形成动态的难度提升机制。与静态奖励函数或固定对手不同,这种设定迫使模型持续适应更强的挑战,生成更精炼的推理链,避免了单一模型 RL 中的停滞或无目的长文生成,训练出的模型在推理时也能自然地以级联方式协作,提升了实际部署的效率和效果。

方法

输入与核心设定

Agon 以两个初始实力相当但行为有差异的模型为起点(可从同一 base model 经不同 SFT 或不同随机种子得到)。训练数据为带可验证最终答案的推理问题,无需任何过程标注或奖励模型。

关键模块:Draft-and-Challenge 自博弈 RL

  1. 角色交替:每步训练中,随机指定一个模型为 Draft(起草者),另一个为 Challenge(挑战者)。两者面对同一问题。
  2. 起草与挑战:Draft 生成完整推理轨迹(trace);Challenge 在阅读该 trace 后独立求解,输出自己的答案。
  3. 奖励机制:奖励基于答案正确性,并引入 conversion bonus(当 Challenge 正确而 Draft 错误时给予额外奖励),鼓励模型超越对手。两个模型各自的回报取决于相对表现,迫使 Draft 写出更难以被反驳的推理,Challenge 则学会有效利用(甚至纠正)对方的草稿。
  4. 优化流程:采用类似 GRPO 的 reinforce 式更新,但同时优化两个模型,角色在 batch 间互换。训练中双方构成一个动态课程 —— 随着优化,每个模型都面对越来越强的对手,这是单模型 RL 无法提供的对抗压力。
  5. 计算量对齐:通过控制采样数量保证两个模型的总推理成本与单模型 GRPO 可比。

推理阶段

训练好的模型按训练时的级联方式部署:Draft 先行生成,Challenge 读取后给出最终答案。整个过程为两阶段,没有额外的模型切换或 ensemble 开销。

与同类方法的差异

GRPO(仅奖励最终答案)相比,Agon 将无标签的推理质量评估隐式编码为相对胜负信号,缓解了“为得分而写长”的长度膨胀。相比于无训练的 Mixture-of-Agents(多模型交叉优化但不训练),Agon 通过对抗性 RL 让模型学会如何合作与批判,性能提升远超单纯推理时集成。

实验

实验设计

实验在数学与代码两个领域展开。主要测试集选用 DeepMath 的困难子集,以 pass@1 为主要指标;编程竞赛在 competitive-programming code 上验证泛化性。模型基座为 Qwen3,并扩展至 Qwen3.5Gemma 4 家族。基线包括:零样本、标准 GRPO、不训练的 Mixture-of-Agents (MoA) 推理集成,以及合作训练变体 CoopAgon 训练中,两个模型交替扮演草稿者与挑战者,基于最终答案正确性与 conversion bonus 给予奖励,且确保计算量公平。推理沿用训练时的两阶段级联:一模型生成草稿,另一模型阅读后作答。采用 2×2 交叉设计验证角色对称性与鲁棒性。

关键发现

  • DeepMath-hard 上,Agon pass@1 达到 61%,是 GRPO(30%)的约两倍,且相对未训练 MoA(34%)提升 27 个百分点。
  • 该优势在 编程竞赛代码 任务中成功复现,表明跨域泛化能力。
  • 跨模型家族(Qwen3.5Gemma 4)的实验显示趋势一致,说明方法不依赖特定模型。
  • 分析揭示,训练后模型生成的推理路径明显缩短,却更有效——因为对手能阅读到草稿,模型被迫写出精炼且具有说服力的推理,而非简单堆砌 token。

与基线的对比解读

Agon 与主流 GRPO 的根本区别在于,它从“仅评判最终答案”变为“通过对手隐式评判推理过程”。GRPO 缺少对思维链的反馈,容易诱发长度膨胀而无实质提升。Agon 利用两个模型相互打分,无需任何过程标签或奖励模型,动态形成“共同进化”的敌方——训练越久,对手越强,这是单模型 RL 所不及的。相较于仅靠推理时集成的 MoAAgon 通过训练使两模型学会竞争与合作,带来的增益远非零成本集成可比:提升幅度约为 MoA 相对于原基座增益的 8 倍。该框架为推理 RL 提供了过程监督的替代路径,有望启发更高效的多模型协同训练范式。

行业影响

落地场景

Agon 可直接用于推理密集型产品,如 AI 编程助手(代码生成与审查)、智能问答系统、数学/逻辑辅导工具等。其双模型起草-审阅范式尤其适合对准确率要求极高的场景,例如代码竞赛平台自动评判、企业决策支持中的复杂报告生成。

商业价值

  • 降本:无需过程奖励模型或人工标注中间推理步骤,仅依赖可验证的最终答案奖励,显著降低数据标注与训练成本。
  • 增收/体验提升:在 DeepMath-hard 上 pass@1 较 GRPO 翻倍,同等推理预算下性能大幅领先,可直接转化为更高的任务完成率和用户留存。同时,模型通过持续竞争自我改进,避免了常规 RL 中“只写长不想深”的长度膨胀问题,长期维护成本更低。

与现有工作流的集成

Agon 训练流程可直接替换 GRPO/PPO 等标准 RL 组件,只需两个行为有差异的同源模型。在推理侧,以两阶段级联方式部署(起草者 → 审阅者解答),与现有模型路由、多模型集成(如 MoA)架构无缝衔接,无需额外基础设施。

具体用例

  1. AI 编程助手(代码生成平台):一个模型生成初步解法,另一个模型审阅并输出最终代码,在竞赛编程或复杂算法实现中可大幅降低逻辑错误,提升首次通过率。
  2. 智能客服系统(电商/金融):处理需多步推理的退换货政策、交易纠纷回答时,两个模型相互挑战,首个模型给出草稿回复,第二个模型审核并优化,减少事实错误,提高解决率与用户信任。

局限

  • **文本媒介为当前瓶颈**:Agon 两个模型通过自然语言文本交换草稿与挑战,这限制了推理过程中的信息密度和效率。论文明确提到“For now the models talk in text; the next step is to let them reason together in latent space”,表明文本交流对于深层推理的传递可能存在表达损耗,未来若能在潜在空间交互,有望进一步提升协同推理的深度与速度。
  • **双模型部署的工程代价**:Agon 训练和推理均需同时运行两个独立模型,且推理是串行两阶段(起草 + 回答),即使统计计算量对等,实际延迟和显存占用仍约为单模型的两倍。虽然论文强调两个模型需“comparably strong and behaviorally different”,但如何持续获得行为差异且避免退化,以及双模型带来的维护复杂性,是其大规模落地前需解决的实际问题。
  • **与过程监督方法的对比缺失**:Agon 通过竞争隐式评分推理过程,避开了昂贵的过程标注,但实验仅与纯结果奖励的 GRPO 和无训练的 MoA 对比,未涉及使用过程奖励模型(PRM)或搜索增强(如树搜索)的方法。这限制了对其在复杂推理任务上优化质量、训练稳定性以及样本效率的综合评估,难以判断在已有过程监督技术面前是否仍有优势。
论文Vladislav Beliaev2026-07-08原文

相关内容