论文

理解从预训练到后训练中的推理

理解从预训练到后训练中的推理

强化学习(RL)已成为提升大语言模型(LLM)复杂推理能力的关键,但RL后训练通常与之前的预训练孤立研究,导致两个基本问题未解:(1) 预训练选择(模型规模、数据)如何影响RL计算收益;(2) RL实际对模型做了什么?这些问题在标准LLM设置中难以研究:预训练语料庞大且不受控,难以归因行为是预训练还是RL导致,且跨两阶段的系统计算扫描成本高昂。 为应对挑战,我们使用国际象棋作为可控测试平台,研究从预训练到后训练全流程的推理。遵循标准LLM训练流程:在人类棋局上预训练5M到1B参数的语言模型,在合成推理轨迹上进行监督微调(SFT),并在带有可验证奖励的象棋谜题上运行RL。利用此框架,我们发现:(1) 给定RL计算水平下的后RL性能可由预训练损失良好预测;(2) RL奖励曲线斜率随预训练token数量近似线性提升。 超越规模缩放,我们发现RL并非简单地强化SFT策略:在简单谜题上,它放大了SFT已偏好的正确走法;而在困难谜题上,它浮现出SFT下几乎缺失的正确走法。为进一步验证迁移性,我们在数学领域文本上训练了1B语言模型,观察到相同的预测模式:预训练更长的检查点达到更高的后RL性能,并在RL下提升更快。 总之,我们提供了预训练到RL接口的定量描述,以及一个用于研究从预训练到后训练全流程推理科学的可控测试平台。

论文精读

TL;DR 以国际象棋为可控推理测试床,首次量化了预训练损失对 RL 后训练性能的预测能力,并发现 RL 能涌现监督微调中未见的正确推理,揭示了预训练–RL 的计算权衡与机制。

问题

问题背景

当前大语言模型(LLM)的推理能力提升高度依赖强化学习(RL)后训练阶段,但 RL 的作用机制及与预训练的关系仍不清晰,业内亟需理解从预训练到后训练的完整推理管线。

现有方法局限

现有工作多将 RL 后训练视为独立环节,未系统考察预训练选择(如模型规模、数据量)对 RL 收敛速率和最终性能的影响。主要原因在于:

  • 标准 LLM 的预训练语料庞大且不可控,难以剥离预训练与 RL 各自的行为贡献,也无法进行受控计算量扫描。
  • 跨预训练与 RL 两个阶段做系统性消融实验的计算开销极高,现有算力条件下几乎不可行,导致缺乏定量预测模型。
  • 多数评估仅关注最终奖励值,忽视 RL 过程中策略演化的动态特征,例如对易/难样本的不同利用方式,使得 RL 的行为刻画流于表面。

为什么这个问题难且重要

从技术角度看,预训练损失、模型容量和 RL 计算量之间存在复杂的非线性交互,需要找到能统一描述跨阶段 scaling law 的变量,并解释 RL 如何从预训练先验中提取有效推理模式。若不解决,业界在分配预训练与后训练算力时只能依赖于经验,可能造成大量资源浪费。此外,随着模型能力逼近瓶颈,理解 RL 在困难样本上“挖掘”稀有正确动作的机制,对设计更高效的推理优化方法至关重要。

行业类比

这类似于在可控仿真环境中先训练自动驾驶感知模型,再用策略梯度算法微调驾驶行为——只有理清预训数据的覆盖度如何影响 RL 的样本效率与安全收敛,才能设计出可规模化的训练方案。

核心洞察

  • 预训练损失(pretraining loss)可以高度预测给定 RL 计算量下的最终性能,且 RL 奖励曲线的斜率随预训练 tokens 呈近似线性提升。这与多数将预训练和 RL 阶段孤立看待的工作不同,该结论首次在受控环境下建立了从预训练到 RL 后训练的定量 scaling law,为实际工程中如何分配预训练与 RL 计算预算提供了可外推的决策依据。
  • RL 并非单纯“锐化”监督微调(SFT)学到的策略:在简单谜题上它放大 SFT 原本偏好的正确走法,而在困难谜题上它能够“浮现”出 SFT 下几乎不存在的正确动作。这一发现挑战了将 RL 仅视为策略蒸馏或偏好强化的主流认知,揭示了 RL 在复杂推理任务中能诱导出新的能力,对设计针对困难问题的 RL 训练策略具有直接启示。

方法

整体 pipeline

输入:人类象棋对局记录(移动序列文本),无额外标注。模型为自回归 Transformer,规模从 5M 到 1B 参数。

三阶段流程:预训练 → SFT → RL

  1. 预训练(Pretraining):仅通过 next-token prediction 在象棋对局文本上训练,获得基础棋步预测能力。
  2. 监督微调(SFT):使用合成推理轨迹(synthetic reasoning traces)进行微调。轨迹由搜索/启发式算法生成,包含局面评估、候选着法分析等逐步推理过程,并格式化为自然语言 CoT 文本。模型在此阶段学会生成带推理的着法。
  3. 强化学习(RL):在象棋谜题上运行 RL,奖励来自可验证奖励(verifiable rewards)——正确解出谜题(如唯一杀法)即得正奖励,信号稀疏但无歧义。RL 算法(如 PPO)基于 SFT 模型进一步优化策略,提升复杂推理任务上的表现。

关键设计:受控测试平台

预训练数据严格限于象棋文本,排除了通用 LLM 中数据混合、规模膨胀等混淆因素,使预训练计算量(FLOPs)、模型大小、数据量与 RL 后训练收益的关系可精确量化。

分析工具

  • 联合预训练–RL 计算量 scaling 曲线:RL 后性能可由预训练 loss 线性预测,且 RL 奖励曲线斜率随预训练 tokens 数近似线性增长。
  • 策略演变分析:将棋步按谜题难度分类,发现 RL 在容易谜题上放大 SFT 已偏好的正确着法,在困难谜题上提升原本概率极低的正确着法,本质是“权衡”而非“锐化”。
  • 方法迁移验证:在数学推理文本上训练 1B 模型,观察到相同规律——更长预训练的 checkpoint 在 RL 后达到更高性能且提升更快。

与同类方法的差异:多数 RLHF 研究将预训练视为给定,未能分离预训练与 RL 的贡献;本工作通过完整受控 pipeline 和跨阶段计算量 sweep,首次建立了从预训练损失到 RL 后性能的预测关系,并揭示了 RL 在不同难度样本上的策略演化机理,而非简单将其视作黑箱。

实验

实验设计

该研究以国际象棋为受控测试平台,复现标准 LLM 训练流程:预训练 → 监督微调 → 强化学习。预训练阶段使用参数规模从 5M 到 1B 的 Transformer 模型,在人类对局数据上自回归建模下一步走法;SFT 通过合成 CoT 推理轨迹让模型生成思考过程;RL 采用带可验证奖励(如是否解出谜题)的棋谜题进行策略优化。为验证泛化性,额外在数学领域文本上训练 1B 模型并进行 RL。

关键发现

  1. 预训练损失 可预测 RL 后性能:给定 RL 计算量的条件下,后 RL 性能可由预训练损失准确预测。
  2. RL 奖励曲线斜率 与预训练 token 数线性相关:预训练越充分,后续 RL 的效率增益越明显。
  3. RL 并非简单强化 SFT 策略:在简单谜题上,它放大 SFT 已偏好的正确走法;在难题上,它挖掘出 SFT 几乎不做的正确动作。
  4. 跨领域迁移:在数学推理任务中,更长预训练的检查点在 RL 后达到更高性能,且提升速度更快,验证了上述规律的普适性。

与基线对比的解读

与传统将预训练和 RL 后训练视作独立阶段的研究不同,该工作首次系统量化了两者间的计算权衡。其发现不仅揭示了预训练质量对 RL 效率的直接制约,也为实际资源分配提供了依据:如果 RL 计算预算固定,更好的预训练能线性提高 RL 改进速率,这暗示着从预训练损失即可预估最终性能上限。该框架弥补了 scaling laws 仅关注单一阶段的不足,为全流程联合优化开辟了新方向。

行业影响

落地场景

论文通过国际象棋作为可控实验环境,揭示了预训练损失与强化学习后训练(Post-RL)的奖励曲线之间的定量关系,并发现 RL 并非简单增强 SFT 策略,而是在困难样本上激发全新正确行为。该框架可直接迁移至需要复杂推理与可验证奖励的产品场景:

  • 代码生成与调试:将代码执行结果作为可验证奖励,预训练阶段用大规模代码库,RL 阶段在编程谜题或测试套件上优化 pass@k。
  • 数学辅导与自动解题:以答案正确性为奖励,RL 后训练可显著提升模型在困难数学题上的正确率。
  • 游戏 AI 与战略决策:在棋类、即时策略游戏中,通过可验证胜负训练模型,用于游戏测试、关卡设计或 NPC 行为生成。
  • 医疗/法律等专业领域:利用结构化问答或病例推断的客观对错作为奖励,预训练用领域文献,RL 用标注案例。

商业价值

论文揭示的预训练-RL 计算投入权衡直接指向成本优化:在给定的 RL 算力预算下,可根据预训练 loss 和 tokens 数较准确地预测最终性能,从而避免盲目扩大预训练或 RL 阶段。

  • 降本:选择预训练充分但不过量的检查点进行 RL,可节省大量预训练计算资源;RL 斜率随预训练 tokens 线性增长,意味着延长预训练能加速后期 RL 收敛,综合计算成本更优。
  • 增收/体验提升:在困难推理任务上,RL 能“解锁” SFT 阶段近乎为零的正确行为,这直接提升产品核心竞争力(如高难度数学题准确率、代码生成一次性通过率),带来用户付费意愿或广告收益增长。
  • 决策支持:预测模型为技术决策者提供量化的“预训练到 RL”投资回报曲线,指导硬件采购与训练日程规划。

与现有产品/工作流的接口

该方案兼容主流 LLM 训练栈,集成成本低:

  1. 预训练阶段沿用标准自回归语言模型训练(如 LLaMA、GPT 架构),仅需将领域数据构造为文本序列(如棋谱、代码文件)。
  2. SFT 阶段生成或收集推理链(reasoning traces)进行监督微调,可采用开源框架如 Hugging Face Transformers + DeepSpeed。
  3. RL 阶段使用可验证奖励的 RL 算法(如 PPO 或 GRPO),奖励函数由环境(编译器、定理证明器、题库判断)提供,可直接集成进现有 RLHF 管线,替换或补充人类偏好奖励。
  4. 预测与监控:根据预训练 loss 和 tokens 预估 RL 提升潜力,可通过日志分析工具(如 WandB)实时监控,指导何时停止预训练进入 RL。

具体落地案例

  • 电商搜索/推荐推理:商品属性与用户意图的复杂匹配可转为推理任务,奖励由点击/转化数据定义。预训练用商品描述和用户行为文本,RL 后训练在历史日志上优化匹配策略,提升长尾查询的召回与转化。
  • 企业级代码助手:预训练在内部代码仓库,SFT 用注释-代码对,RL 基于单元测试通过率。企业可在保护隐私的前提下,用较小算力获得针对自身代码库高度优化的补全与调试模型。

局限

  • **领域与任务泛化受限**:本文以国际象棋作为可控测试平台,并仅在数学领域做了初步定性迁移实验。这类环境具有密集、可自动验证的奖励信号,但现实中的自然语言推理任务(如开放域问答、长文本生成)往往奖励稀疏、主观性强,且无标准化验证器。因此,该框架能否推广到更通用的 NLP 推理基准(如 GSM8K 之外的复杂数学、代码生成、科学推理等)尚不明确,论文未提供大规模多任务证据。对于行业应用,直接套用此框架训练通用 LLM 可能仍然面临奖励设计与评估的严峻挑战。
  • **模型与数据规模局限**:实验最大模型仅 1B 参数,预训练数据为特定的人类棋局记录或领域数学文本,远小于现代 LLM 训练所用的数 T tokens 互联网语料。文章揭示的预训练损失与 RL 奖励间的幂律关系,以及 RL 斜率随预训练 tokens 的线性增长,在更宽泛的规模下是否依然成立,是否会出现饱和或相变,无法从现有数据中推出。实际训练十亿以上参数模型时,计算分配策略可能需要重新校准,限制了结论的直接工程指导价值。
  • **可控环境与真实分布的差距**:chess 预训练数据格式高度结构化(标准棋步序列),而互联网文本包含噪音、多语言、代码、对话等异质内容。在可控合成数据上观察到的“RL 在难题上浮现正确动作”现象,其具体机制——例如模型如何在棋盘状态空间中规划——可能过度依赖域内强约束。直接迁移到开放词汇、多步推理的真实文本场景时,RL 的探索效率与行为变化模式可能显著不同,论文对此缺乏深度剖析,更像提供了一个隔离条件下理想化的科学抽象,简化了实际预训练中的复杂交互。
论文Jingyan Shen2026-07-17原文

相关内容