论文

Next-Chunk Reasoning RL 真的比 SFT 更好吗?重新审视无 CoT 数据下的训练策略

Next-Chunk Reasoning RL 真的比 SFT 更好吗?重新审视无 CoT 数据下的训练策略

近年研究提出 next-chunk reasoning RL,用于利用无 CoT 数据——例如包含丰富推理内容但缺乏显式思维链标注的解题过程和教科书推导。该方法训练模型生成隐式推理轨迹,并以预测下一个文本块的能力作为奖励。尽管初步结果令人鼓舞,但现有评估主要与常规 SFT 基线对比,未能区分性能提升究竟来自 RL 框架 本身,还是更有效地暴露模型于无 CoT 数据。 我们通过对照实验回答这一问题:比较 next-chunk reasoning RL 与一个简单但此前被忽视的替代方案——Mixed SFT,即在单一监督微调阶段联合训练无 CoT 数据和长 CoT 数据。尽管 Mixed SFT 极其简单,它在 RLVR 后的性能上限明显高于 next-chunk reasoning RL,同时训练计算量降低超过 60 倍。该优势在领域内数学推理和领域外推理任务中均保持一致。 此外,我们发现 RLVR 前准确率较高并不必然带来 RLVR 后准确率更高,这凸显了在完整后训练流程中评估无 CoT 训练策略的必要性。

论文精读

TL;DR 本文通过对照实验发现,混合 no-CoT 与 long-CoT 数据的单阶段监督微调(Mixed SFT)比 next-chunk reasoning RL 更优,post-RLVR 性能更高且训练计算少 60 倍以上。

问题

问题背景

当前推理模型后训练聚焦于如何利用 no-CoT 数据——例如工作解答、教材推导等包含丰富推理过程但缺少显式思维链标注的语料。这类数据量大且获取成本低,若能被有效利用,可显著扩展推理训练数据规模。

现有方法局限

Next-chunk reasoning RL 通过训练模型生成隐式推理轨迹,并以预测下一文本块的能力作为奖励信号,从而间接利用 no-CoT 数据。然而已有评估存在明显缺陷:

  • 主要对比对象仅为常规 SFT 基线,未控制“数据暴露程度”这一变量,无法判断性能提升来自 RL 公式本身,还是来自更充分地让模型接触 no-CoT 数据。
  • 传统 SFT 无法直接利用缺少推理步骤标注的数据,导致 no-CoT 数据中的推理信息被浪费。
  • 现有工作多在 pre-RLVR 阶段单独评估,忽略完整后训练管线中 RLVR 对最终精度的影响——pre-RLVR 精度高并不保证 post-RLVR 精度高。

为什么这个问题难/重要

技术上,no-CoT 数据的推理结构是隐式的,监督信号需要从原始文本中自我构建,而 RL 训练又涉及奖励建模、策略优化等复杂环节,计算开销大且稳定性差。业界对推理模型后训练的效率与成本高度敏感,是否存在更简单、更廉价的数据利用方式,直接关系到推理模型规模化训练的现实可行性。

行业类比

类似在弱监督场景中,用 Mixed SFT 混合监督微调替代复杂的强化学习流程,能以极低计算成本获得更高的最终推理能力,这对资源受限的推理模型训练具有直接借鉴意义。

核心洞察

  • **忽略简单基线是常见陷阱:混合 SFT(Mixed SFT)在利用 no-CoT 数据上比专门的 next-chunk reasoning RL 更高效。** 论文通过受控实验揭示,先前工作之所以认为 RL 更优,主要是因为对比的 SFT 基线未联合训练 long-CoT 与 no-CoT 数据。混合 SFT 单阶段训练即可达到更高的 post-RLVR 上限,且训练计算量降低 60 倍。这提醒研究者在提出复杂 RL 方法前,先彻底探索监督学习的数据组合策略。
  • **评估时机改变结论:pre-RLVR 准确率不能预测 post-RLVR 表现。** 许多工作仅报告 RLVR 前的模型精度来选择 no-CoT 训练策略,但该论文发现更高 pre-RLVR 分数不一定转化为更高 post-RLVR 分数。因此,no-CoT 数据利用方法的价值必须在完整后训练 pipeline(包括后续 RLVR 阶段)中评估,否则会得出误导性结论。这一发现对训练流程设计与模型选型具有直接工程意义。

方法

Mixed SFT 是一种针对 no-CoT 数据利用的简单而高效的训练策略。其核心思想是将 no-CoT 数据(如 worked solutions、textbook derivations,缺乏显式 chain-of-thought 标注)与 long-CoT 数据(包含详细推理步骤)混合,在单一监督微调(SFT)阶段联合训练模型。

输入:两类数据——no-CoT 数据本身含有丰富推理内容但未标注中间步骤;long-CoT 数据则提供显式推理链。

关键模块:

  • 数据混合:将两类数据按一定比例混合(论文研究了混合比例的影响),构成统一训练集。
  • 标准 SFT 目标:采用 next-token prediction 损失,让模型直接学习从问题到答案的映射。对于 no-CoT 数据,模型隐式地从完整推理内容中学习中间推理能力,无需显式生成 CoT。
  • 单一阶段训练:不引入额外 RL 阶段,直接在一个 SFT 阶段完成,极大降低训练复杂度。

输出:训练后的模型具备更强的推理能力,尤其在后续 RLVR(RL with Verifiable Rewards)阶段表现出更高的性能上限(post-RLVR accuracy)。论文实验表明,Mixed SFT 在域内数学推理和域外泛化任务上均优于 next-chunk reasoning RL,且训练计算量减少 60 倍以上。

与 next-chunk reasoning RL 的差异点:Mixed SFT 通过简单的联合监督学习替代复杂的 RL 框架,在更低计算成本下更高效地利用 no-CoT 数据,避免了 RL 训练中的不稳定性和奖励设计难题。

实验

实验设计

作者设计了一项受控研究,对比 next-chunk reasoning RL 与 Mixed SFT 两种利用 no-CoT 数据的训练策略。Mixed SFT 是单阶段监督微调,在 no-CoT 数据(如 worked solutions、textbook derivations)与 long-CoT 数据 上联合训练。评估覆盖域内数学推理和域外推理任务,并同时测量 pre-RLVR 与 post-RLVR 准确率,以考察完整后训练管线中的表现。

关键发现

  • Mixed SFT 达到的 post-RLVR 性能上限 明显高于 next-chunk reasoning RL,且训练计算量减少 60 倍以上。
  • 该优势在域内数学推理和域外推理任务上保持一致,说明简单方法具有更好的泛化性。
  • pre-RLVR 准确率更高并不必然转化为 post-RLVR 准确率更高,提示仅看 pre-RLVR 指标会得出误导性结论。

与基线对比的深度解读

此前工作主要将 next-chunk reasoning RL 与传统 SFT 基线比较,无法区分性能增益来自 RL 公式本身还是更有效的数据暴露。本研究表明,一个简单的混合 SFT 即可在最终 RLVR 后取得更好效果,说明增益主要源于更充分地利用 no-CoT 数据,而非 RL 机制。这强调评估 no-CoT 训练策略时必须在完整后训练流程(包含后续 RLVR 阶段)中进行,而不是孤立地评估某个中间阶段。

行业影响

落地场景

Mixed SFT 适合团队已积累大量无显式 CoT 的推理富文本——如内部知识库、教科书式推导、历史解决方案、代码注释里的推导逻辑。典型场景:

  • 在线教育:题库包含海量“解题步骤”但未标注逐步推理;Mixed SFT 可联合已有 long-CoT 样本训练,产出能做分步讲解的答疑模型,无需重写全部数据。
  • 企业服务:客服工单、内部 wiki、合规文档往往只有最终结论和部分推导;用它预训练/微调后再接 RLVR,比 next-chunk RL 省 60 倍以上算力,且 post-RLVR 准确率更高。

商业价值

论文核心发现:高 pre-RLVR 准确率不必然带来高 post-RLVR 准确率。Mixed SFT 用单阶段 SFT 替代 next-chunk RL 的复杂奖励设计,训练成本降一个数量级;对中小企业/研究组,能更便宜地利用已有 no-CoT 数据提升最终 RLVR 后效果。同时,更简单的流程降低工程维护成本,训练稳定性更好。

与现有工作流接口

直接嵌入标准 post-training pipeline:SFT(混合 no-CoT + long-CoT) -> RLVR。无需为 next-chunk 设计额外 reward model 或在线采样器;数据侧只需在 SFT 阶段按一定比例混合两类文本。现有 LLM 训练框架(如 transformers、Megatron)可复用,RLVR 阶段保持不变。

局限

  • - **领域覆盖与混合比例**: 作者在附录中承认, 实验主要覆盖数学推理及有限的 OOD 任务, 混合比例的选择也仅在少数取值上做消融, 缺乏对更广泛领域(如代码、科学问答)和更细粒度混合策略的验证, 结论的泛化性仍需进一步检验。
  • - **模型与 RL 实现的单一性**: 实验基于单一基座模型(未明确但可从上下文推断), 且 next-chunk reasoning RL 的具体实现可能受限于当前超参数与奖励设计; 作者未与更先进的过程奖励模型或不同 RL 算法(如 PPO 变体)对比, 因此不能排除更优 RL 配置下 next-chunk 方法反超的可能。
  • - **机制解释不足**: 论文证明了 Mixed SFT 在 post-RLVR 性能上优于 next-chunk reasoning RL, 但未深入分析联合训练 no-CoT 与 long-CoT 数据为何能提高 RLVR 上限, 缺少可操作的机理指导, 对实际工程调优的启示有限。
论文Yinhao Tang2026-08-24原文

相关内容