论文

从推理链到可验证子问题:课程强化学习实现LLM推理的信用分配

从推理链到可验证子问题:课程强化学习实现LLM推理的信用分配

基于可验证奖励的强化学习(RLVR)在LLM推理中展现出潜力,但基于结果的RLVR在困难问题上效率低下,因为正确的最终答案轨迹稀少,且样本级信用分配无法利用失败尝试中的部分进展。 本文提出SCRL(子问题课程强化学习),一种课程RL框架,从参考推理链中推导出可验证的子问题,并将最终子问题固定为原始问题。这使困难问题上的部分进展转化为可验证的学习信号。算法上,SCRL采用子问题级归一化,在每个子问题位置独立归一化奖励,并将获得的优势分配给对应的答案跨度,从而实现无需外部评分或奖励模型的更细粒度信用分配。 分析表明,子问题课程将困难问题从梯度死区中解救出来,且原始问题越难,相对增益越大。在7个数学推理基准(包括AIME24、AIME25、IMO-Bench)上,SCRL优于强课程学习基线。在Qwen3-4B-Base上,平均准确率比GRPO提高+4.1点;在Qwen3-14B-Base上提高+1.9点。在AIME24、AIME25和IMO-Bench上,SCRL在Qwen3-4B-Base上进一步将pass@1提升+3.7点,pass@64提升+4.6点,表明在困难推理问题上探索更有效。

论文精读

TL;DR SCRL 从推理链自动拆解可验证子问题构建课程,结合子问题级奖励归一化实现细粒度 credit assignment,让 RLVR 从部分成功中学习,突破困难问题的梯度死区,大幅提升数学推理性能。

问题

强化学习与可验证奖励 (RLVR) 在提升 LLM 推理能力方面潜力显著,但在 高难度数学推理任务 (如 AIME、IMO 等竞赛题) 上仍面临效率瓶颈。现有方法 (如 GRPO) 多采用 结果级奖励,即仅当模型生成完整正确答案时才给予正向信号。这导致两个关键局限:(1) 难题上正确轨迹极为稀疏,大部分 rollout 因最终答案错误而被整体视为失败,损失了大量中间推理步骤的部分进展信息;(2) 样本级信用分配 (credit assignment) 无法区分哪些中间步骤对正确答案有贡献、哪些导致错误,梯度更新缺乏细粒度引导,训练容易陷入“梯度死区”,长期难以跳出局部最优。

这一问题的核心难点在于:如何在不依赖外部过程监督 (process reward model) 或人工标注的情况下,自动将难题拆解为可独立验证的子问题,并将子问题的可验证奖励转化为有效的学习信号?同时,不同子问题的难度和奖励尺度差异巨大,直接混合训练会引入噪声,需要精确的 奖励归一化与优势分配机制。业界对 LLM 推理能力的追求正从简单任务转向竞赛级、科学推理等复杂场景,而 RLVR 的稀疏奖励问题已成为制约 scaling 的显性瓶颈。

这一挑战类似于 自动驾驶中的稀疏奖励问题:车辆仅到达终点才获得正向反馈,过程中无数正确的驾驶决策 (避障、车道保持) 均无法作为训练信号。子问题课程学习可类比为将完整驾驶任务分解为“转弯”、“减速”、“变道”等可独立评估的子任务,从而以更高密度信号加速策略学习。

核心洞察

  • **子问题分解+位置感知归一化把局部进展变成有效学习信号**:SCRL 将原问题按参考推理链自动拆解为一系列可独立验证的子问题,并对每个子问题位置的奖励做独立归一化,将优势细粒度分配到对应的答案片段。相比传统 GRPO 只对完整答案进行奖励,该方法能让模型从失败尝试中识别出部分正确的步骤,大幅缓解结果奖励 RL 面临的稀疏奖励和信用分配难题,且无需外部评分模型或标注规则。
  • **子问题课程实现无人工介入的由易到难训练,自然提升探索效率**:SCRL 以最后一个子问题固定为原问题,构建递进式课程,训练初期模型先学习易子问题,逐步提升复杂度;借助子问题级归一化与混合组训练,模型无需手工设计课程进度,也无需精心筛选高质量子问题。理论分析证明,这种课程能将困难问题移出梯度死区,获得的增益随原问题难度增加而扩大,在 AIME 和 IMO-Bench 等极限基准上 pass@k 提升显著。

方法

方法流程

输入:原始数学推理问题。

关键模块

  1. 子问题构建

    • 从预生成的参考推理链(如通过 SFT 或蒸馏得到)中自动抽取可验证的子问题序列
    • 子问题被组织成课程:从简单到困难,最后一个子问题固定为原始问题
    • 每个子问题具有独立的答案格式,支持自动化答案验证。
  2. 课程训练与奖励设计

    • 课程动态推进:训练初期优先采样简单子问题,随着训练步数增加,逐渐提高后续子问题的采样概率,实现自动的难度递增。
    • 进度感知奖励修正:对于模型生成的子问题答案,若当前子问题回答错误,但前置子问题均正确,仍给予部分正向奖励,将部分进展转化为有效学习信号,而非全盘否定失败的 rollout。
  3. SCR 训练算法

    • 子问题级归一化:不再像 GRPO 那样对整个 rollout 的奖励进行全局归一化,而是在每个子问题位置独立计算组内优势函数。这避免了不同难度子问题之间的奖励方差干扰,实现更稳定的梯度估计。
    • Token 级信用分配:将子问题级优势值分配到对应子问题的答案 token span 上,其他 token(如推理逻辑链)不接收信号,从而实现对成功推理片段的精确奖励。
    • 混合组训练:同一批次同时采样不同子问题索引的轨迹,通过子问题级归一化消除位置偏差,让模型能高效共享不同难度的经验。

输出:经过课程强化学习训练的 LLM,在保持整体推理能力的同时,显著提升对困难数学问题的探索效率与最终准确率。

与同类方法的差异:不同于仅奖励最终答案正确的 GRPO 等结果级 RLVR,SCRL 通过子问题课程 + 子问题级归一化,使未完全成功的尝试也能获得细粒度信用分配,从而将困难问题从梯度死区中“拉起”,在无需额外奖励模型或人工评分标准的情况下,实现更高效的探索。

实验

实验设计

SCRL 在 GRPO 基础上引入子问题课程学习子问题级别归一化。首先利用参考推理链将原问题分解为可验证的子问题序列,最终子问题固定为原问题;训练时模型按课程顺序逐个子问题生成回答,每步获得二值可验证奖励。奖励通过位置感知的归一化转化为优势,并分配到对应回答片段(而非整轮样本),实现细粒度信用分配。主要实验在 Qwen3-4B‑BaseQwen3‑14B‑Base 上进行,涵盖 7 个数学推理基准(含 AIME24AIME25IMO‑Bench 等),采样策略固定为同一子问题内采样,同时混入同难度的非子问题数据以防止分布偏移。基线包括 GRPODAPONuRL 等强过程引导或课程学习方法,均在同等训练步骤下对比。

关键发现

SCRL 在所有基准上均一致优于 GRPO,且难题收益更显著。在 Qwen3-4B‑Base 上,7 基准平均准确率提升 +4.1 点,在最具挑战性的 AIME 与 IMO 组合上 pass@1 进步 +3.7 点pass@64 进步 +4.6 点;Qwen3‑14B‑Base 也获得 +1.9 点的平均提升。消融实验表明,课程结构本身(子问题拆解)贡献巨大,但子问题级别归一化是关键使能技术——换成全局归一化后性能大幅回退,说明位置感知的信用分配能有效将部分进度转化为学习信号。同时,SCRL 的课程迁移能力使模型在未教过的子问题上也能增益,且对子问题生成的精度不敏感,有一定鲁棒性。

与基线的深度对比

主流 RLVR 方法(如 GRPO)依赖最终答案正确率,难题上奖励稀疏,错误 rollout 中的推理步无法获得有效反馈。DAPO 等通过动态采样或逐题难度过滤缓解该问题,但仍未在 token 层面分配信用。SCRL 通过将难题自动拆解为一系列有独立可验证奖励的子问题,使稀疏奖励问题变为稠密监督,优势互补:课程提供结构先验,归一化将子问题级的反馈精准分配至对应生成段。这不同于需要外部过程奖励模型的方案,避免了奖励 hacking 和昂贵标注,工程上更易部署。在同等算力下,SCRL 在难题上的探索效率显著优于现有课程学习基线,证实了“分解难度 + 细粒度信用”可以提升 RL 对齐的样本效率,尤其适用于数学推理等具有天然层次结构的问题域。

行业影响

落地场景

SCRL 可直接嵌入需要复杂多步推理的 AI 产品中,例如数学解题助手、代码生成与调试工具、科学计算平台、金融建模辅助系统。对任何依赖 LLM 生成最终答案且可通过可验证奖励(答案对错、编译通过、数值匹配)进行强化的场景,SCRL 通过将困难问题自动拆解为子问题课程,把原本无用的失败尝试转化为有效训练信号,尤其适合那些正确rollout稀缺的长尾难题。在编程教育、量化分析、药物分子推理等垂直领域,它能显著提升模型对复杂链路的探索能力。

商业价值

SCRL 的核心商业优势在于降低高质量推理数据的获取成本。传统 RLVR 面对困难任务时,因稀疏奖励导致训练低效,需要大量采样才能偶然命中正确答案。SCRL 利用子问题级别的信用分配,让模型从部分正确推理中学习,同等计算预算下提升模型在困难基准上的 pass@k(如 AIME24 pass@1 +3.7),直接转化为模型性能提升带来的产品竞争力。同时,它无需过程奖励模型或人工标注步骤得分,进一步压缩了训练体系的维护成本。对 API 服务商而言,更高的推理准确率意味着更少的用户抱怨和更低的 token 浪费。

与现有产品 / 工作流的接口

SCRL 算法可作为强化学习微调阶段的即插即用升级。它基于 GRPO 等现有 RLVR 框架,仅需将训练数据重构为子问题课程格式,并在奖励计算中引入子问题级归一化,不改变模型架构或推理流程。集成时,工程师可在现有训练管线(例如 SFT → GRPO)中插入一个子问题生成模块(利用参考推理链自动拆分),训练完成后直接部署标准模型,无需额外的推理时开销。硬件方面,与标准 GRPO 训练相近,现有 GPU 集群可直接支持。

具体用例

  • 在线教育平台(如全球性编程学习服务):在代码练习环节,平台可使用 SCRL 训练模型生成分步提示——即使学生代码未完全通过,模型也能识别出子步骤的正确性并给出针对性反馈,提升学习体验和留存率。
  • 企业级数据分析问答系统:在金融或供应链场景,分析师提出多级计算问题(如“先过滤再聚合再预测”)。SCRL 训练后的模型能更稳定地完成每个中间步骤,减少因某个子计算错误导致的整体失败,从而提升 BI 工具的自主问答可靠性,减少人工核查成本。

局限

  • 子问题生成依赖参考推理链的质量,论文使用 GPT-4o 或类似强模型生成链,这在实际部署中可能成本较高,且链的合理性与完备性会直接影响课程效果。对于没有清晰中间步骤的开放域任务,构造可验证子问题的难度较大,限制了方法的通用性。
  • 实验仅覆盖数学推理基准(如 AIME、IMO),未展示在代码生成、科学推理等领域的表现。尽管附加实验略微提到 OOD 泛化,但主要结果仍局限于数学,缺乏多领域验证,可能高估方法的普适性。
  • SCRL 虽然提升了困难问题的探索效率,但训练时需同时处理多个子问题和混合分组,相比 GRPO 增加了训练复杂度和计算开销。论文未详细讨论超大规模模型(如 70B+)上的扩展性,实际落地时可能面临资源约束。
论文Xitai Jiang2026-05-21原文

相关内容