ExpRL: 面向LLM中间训练的探索性强化学习
稀疏奖励强化学习(RL)已成为提升LLM推理能力的标准工具,但其成功严重依赖于基础模型中的覆盖范围。实践中,模型通常通过在精心策划的推理轨迹上进行中间训练来为RL做准备,这些轨迹教授有用的基本技能,如分解、验证或自我修正。尽管有效,但这种策略需要手动指定模型应学习的内容,并且尚不清楚这种基本覆盖是否足以应对更难的问题,这些问题需要将这些技能组合成更广泛的解决策略。 我们研究了一种更自动化的方法:基于RL的中间训练,使用大规模人工编写的问题-答案数据。我们的方法ExpRL并非将参考解决方案视为模仿目标,而是将其用作奖励支架:参考被隐藏,只用于构建问题特定的评分标准,以判断策略上的推理轨迹。策略从原始问题提示中采样,而LLM评判器将采样的推理轨迹与参考解决方案进行比较,并分配结果级或过程级的密集奖励。这使得ExpRL能够强化部分进展、有用的中间归约以及稀疏最终答案奖励往往无法加权的富有成效的推理行为。 在挑战性的数学推理任务上,ExpRL比SFT、稀疏奖励GRPO和自蒸馏提供了更强的RL初始准备,并为后续的稀疏奖励RL提供了更好的初始化。额外的混合领域实验进一步表明,ExpRL可以扩展到原始的纯数学设置之外。
论文精读
TL;DR ExpRL 将人类参考答案作为奖励支架,由 LLM 评判器生成密集过程奖励,为语言模型提供更优的 RL 预训练初始化,在数学推理上超越 SFT 和稀疏奖励方法。
问题
问题背景
大语言模型(LLM)的推理能力提升正逐步依赖稀疏奖励强化学习(RL),但 RL 成功的前提是基座模型具备足够的探索覆盖度,否则难以发现有效推理轨迹。
现有方法的局限
当前主流方案通过**中期训练(mid-training)**注入先验知识,例如在人工精选的推理样本上做监督微调(SFT),教授分解、验证、自纠正等基础技能。然而该方法存在三个明显局限:
- 手动设计课程:需要领域专家预先定义模型应学习的技能集合,扩展性差,且无法覆盖所有未知解法;
- 模仿学习瓶颈:直接拟合参考解答会限制策略探索,模型容易过拟合表面模式,而非习得通用推理策略;
- 奖励信号稀疏:下游 RL 阶段(如 GRPO)通常仅对最终答案正确性给出奖励,忽略中间步骤的合理进展,导致大量有价值的探索过程被丢弃,训练效率低下。
为何该问题重要且困难
让模型自动化地从海量人类问答数据中提取推理引导信号,而非被动模仿,是提升 RL 上限的关键。技术难点在于:在不直接暴露参考答案的情况下,如何构建既稠密又无偏的奖励函数,既能区分局部进展,又不引入过强的答案泄露。业界高度关注此类方法,因为它能降低人工标注成本,同时提升模型在复杂数学推理、代码生成等长程任务上的表现稳定性。
行业类比
类似自动驾驶中利用人类驾驶数据作为稠密奖励训练规划模型,而非仅依赖“到达终点”的稀疏信号,使得模型能够在每个局部决策中获得反馈,加速收敛。
核心洞察
- ExpRL 的核心洞察是将人类编写的参考答案从“模仿目标”转化为“奖励支架”:参考答案不暴露给策略,而是作为构造逐题评分细则的依据,由 LLM 裁判对照策略采样轨迹给出稠密奖励。与传统 SFT 的直接模仿或以最终答案对错为信号的稀疏奖励 RL(如 GRPO)相比,这种设计让模型不必机械复制完整参考解,却能得到过程级的逐步反馈,从而更有效地鼓励部分进展、中间归约和推理行为的多样性。
- ExpRL 的另一个关键发现是,以稠密奖励引导的 RL 中训练(mid-training)能为后续的稀疏奖励 RL 提供更强的初始策略。与 SFT、稀疏奖励 GRPO 甚至自蒸馏基线相比,ExpRL 初始化的模型在后续 RL 中收敛更快且最终上限更高。这表明通过奖励支架注入的过程性认知信号比静态数据中的模式更能塑造可泛化的推理策略,为自动化课程学习提供了一种实用范式。
方法
ExpRL 将人类编写的问答数据转化为奖励脚手架 (reward scaffolds),在不向策略暴露参考解的前提下,为 RL 中训练 (mid-training) 提供自动化密集奖励信号。
输入与关键模块
数据构造
- 输入为标准 QA 对:问题
q与参考解a_ref(人类撰写)。 a_ref不喂给被训练的策略,仅用于构建评分标准。
- 输入为标准 QA 对:问题
策略采样
- 策略模型仅从
q出发,生成多个 on-policy 推理链τ ~ π(·|q)。 - 采样保留了探索自由度,避免直接模仿参考解的短视行为。
- 策略模型仅从
LLM Judge 评分
- 一个独立的 LLM 评委 对比每个
τ与a_ref,按问题特异的评分标准给出奖励:- 结果级奖励:依据最终答案与参考解一致性判断。
- 过程级密集奖励:按推理步骤切片,识别局部进展(如正确分解、有用转换、自我纠正),对中间步骤赋分。
- 评委 prompt 内置通用评判原则,并结合
a_ref动态生成每题的细粒度 rubric,减少人工定制。
- 一个独立的 LLM 评委 对比每个
RL 优化
- 奖励信号
r(τ)(整条或逐步)替换传统稀疏奖励,用于更新策略。 - 实验主要采用 GRPO 或其变体,配合优势中心化等稳定训练技巧。
- 训练目标鼓励策略不仅达到正确答案,更重视推理行为质量(如探索有效中间状态)。
- 奖励信号
输出
- 产出经过 RL 中训练 的策略模型,该模型在下游困难推理任务上具备更强的初始化能力:
- 比 SFT 基线和稀疏奖励 GRPO 更好支持后续 RL 微调。
- 在预训练知识基础上,自发掌握分解、验证等复合策略。
与同类方法的差异
区别于 SFT(直接模仿参考解,限制探索)和 稀疏奖励 RL(仅奖励最终答案,忽略过程进步),ExpRL 通过 隐藏参考解 + LLM Judge 提供过程密集奖励 实现了自动化探索引导,使得策略能在不损失覆盖度的情况下习得可泛化的推理行为。
实验
实验设计
ExpRL 利用人类编写的 问答数据 作为奖励脚手架,隐藏参考解,仅用 LLM judge 对策略采样的推理轨迹进行比对评分,提供 结果级或过程级稠密奖励。在 数学推理任务 上进行 RL mid-training,基线对比包括 SFT、稀疏奖励 GRPO 和 自蒸馏,并评估下游稀疏 RL 的初始化质量。额外 混合领域实验 验证方法泛化性。
关键发现
- 稠密奖励 有效强化部分进展、中间推导和有效推理行为,缓解稀疏奖励信号不足的问题。
- ExpRL 的 RL priming 显著优于 SFT、GRPO 和自蒸馏,并为后续稀疏 RL 提供 更优初始化。
- 过程级奖励 结合 优势中心化 进一步提升学习效率。
- 方法在数学之外混合领域仍表现稳定,具备跨任务适应潜力。
基线对比深度解读
SFT 直接模仿参考解,限制策略探索能力;稀疏奖励 GRPO 仅在最终答案正确时给奖励,忽略中间推理步骤的部分正确性,导致困难问题中有效行为被严重稀释。ExpRL 通过隐藏参考解、用 LLM judge 构建动态评分标准,对策略轨迹的细微进步也给予信号,使模型能自主组合多步推理技能,更适应组合性强的难题,且这种 priming 方式与下游稀疏 RL 无缝衔接,避免手工指定技能的局限性。
行业影响
落地场景
ExpRL 的核心机制是利用人类撰写的 QA 数据构建稠密奖励信号,在 RL 中期训练中自动提升 LLM 的推理能力,尤其适合需要多步数学推理、逻辑验证或策略组合的业务场景:
- 在线教育:智能辅导系统解答复杂数学题时,ExpRL 能让模型学会分解、验证、自我纠正,生成更可靠的逐步解析,而非只给最终答案。
- 金融分析:自动生成财报解读、风险评估报告时,模型需综合多源数据并展示推理链,ExpRL 预训练可提升报告的可信度与可审计性。
- 编程辅助:代码生成任务中,参考解作为 scaffolds,judge 对比推理轨迹,可强化局部正确实现与调试能力,减少一次性错误。
- 客服知识库:处理多约束退款、物流计算等问题时,模型能展示推理步骤,减少错误决策。
商业价值
| 维度 | 收益机制 |
|---|---|
| 降本 | 替代人工策划的课程式 SFT 数据,利用现有 QA 语料即可实现自动化 RL priming,减少数据标注与专家迭代成本。 |
| 增收 | 更强的推理基座能提升产品竞争力,在教育、金融等高附加值领域可直接转化为付费功能或服务溢价。 |
| 体验提升 | 稠密奖励使模型对部分进展更敏感,避免稀疏奖励导致的盲目探索,生成过程更符合人类思考习惯,用户信任度上升。 |
与稀疏奖励 RL(如 GRPO)相比,ExpRL 能提供更好的 RL 初始化,大幅减少后续稀疏奖励阶段的训练步数,降低总体算力开销。
与现有产品/工作流的接口
ExpRL 适合作为现有 RLHF/RLAIF 管线的前置阶段,无需改动原有框架:
- 从已有 QA 数据库提取 reference 作为 scaffolds,调用 LLM judge(如 GPT-4 或更小规模 judge)生成稠密奖励。
- 在标准 RL 框架(如 vLLM + Ray)中运行 PPO/GRPO 变体,对基座模型进行 mid-training。
- 产出 primed policy 后,无缝衔接到下游的稀疏奖励 RL 或指令微调。
与当前主流工具集成:
- 可在 OpenAI API 或自定义 judge 服务之上构建奖励生成层。
- 训练出的模型可直接部署到 HuggingFace TGI、vLLM 等推理引擎。
- 对混合领域数据的实验表明,即使 judge 规模较小,ExpRL 依然有效,降低了部署门槛。
局限
- **依赖高质量参考答案**:ExpRL 将人类编写的解题过程作为奖励脚手架,这就要求训练数据中的参考答案必须足够详尽和正确。如果参考答案存在错误或不完整,LLM 评判器可能给正向的推理步骤打出不合理的高分,进而误导策略模型。当前实验使用的数学领域数据相对规范,但推广到开放性更强的任务时,获取高质量的参考将变得困难。
- **LLM 评判器的瓶颈**:过程奖励的密集程度高度依赖于评判器模型的能力。评判器需要具备跨多种推理路径的评估泛化能力,而论文中使用的评判器规模与策略模型相近(如 Qwen2.5-7B),这在大规模训练时会带来显著的计算开销和延迟。同时,评判器自身的偏见(如长度偏好、格式偏好)也可能被策略模型利用,产生奖励黑客行为。
- **领域泛化验证有限**:尽管论文在混合领域数据上进行了初步实验,但主体实验均在数学推理(MATH、GSM8K 等)上开展。数学问题具有明确的对错标准,适合构造过程奖励。对于需要主观评价、创造性或长链推理的任务(如代码生成、科学问答),该方法是否依然有效且不引入偏差,尚缺乏充分验证。