使用自生成数据的中期训练提升语言模型中的 Reinforcement Learning
Reinforcement Learning (RL) 在大型语言模型(LLMs)中的有效性取决于 RL 训练前和训练中所用数据的性质与多样性。特别是,推理问题往往可以通过多种方式解决,这些方式依赖不同的推理形式,而训练数据中仅接触到有限范围的此类方法可能限制 RL 的效果。基于此,我们研究在 RL 训练之前,使用多样化的自生成数据进行中期训练作为中间步骤。具体而言,我们采用一个受 George Polya 问题解决框架启发的引导式数据生成方法,为训练数据中的每个问题生成多个正确答案变体,然后进行微调。 我们首先从理论角度阐明,在中期训练中使用此类数据如何改善 RL,并解释策略梯度更新如何激励多种方法的组合。接着,我们通过实验证明,使用我们的中期训练数据初始化的 RL 训练模型在多个数学推理基准以及其他 OOD 任务(如代码生成和叙事推理)上取得了一致的改进。总体而言,我们的研究表明,语言模型通过自生成数据学习多种问题解决策略有助于后续的 RL。
论文精读
TL;DR 在强化学习前,用基于 Polya 方法的自生成多解题数据进行中训练,能显著提升语言模型的数学推理与泛化能力。
问题
问题背景
大语言模型 (LLM) 的强化学习 (RL) 训练(如 RLHF 或基于 verifier 的 RL)在数学推理、代码生成等任务中展现出巨大潜力。研究者普遍关注如何通过 RL 提升模型的复杂推理能力,但训练数据的多样性与策略覆盖度对最终性能的影响尚未被充分理解。
现有方法局限
当前 RL 训练通常依赖固定的监督微调 (SFT) 数据或有限的采样路径,导致模型暴露的问题求解方式较为单一。例如,在数学推理中,同一问题可能通过代数、几何或枚举等多种路径解决,但若 SFT 数据只包含少数典型解法,RL 的探索空间被显著压缩。策略梯度更新倾向于强化高频出现的推理模式,缺乏多样性会使得模型在遇到分布外 (OOD) 问题时难以泛化。此外,直接增加 SFT 数据成本高昂,且人工构造多样化解法难以规模化。
为何问题重要/难
多样性缺失对 RL 训练的负面影响存在理论根源:策略梯度更新的方差与状态-动作空间的覆盖度直接相关,有限的解法覆盖会导致值函数估计偏差,进而误导策略优化方向。工程上,捕捉人类解题策略的完整分布几乎不可能,因此需要一种可自动扩展解法多样性的机制。该问题在业界关注度极高,因为提升 RL 训练效率和 OOD 泛化能力意味着减少昂贵的人工数据依赖,并提升模型的鲁棒性。
行业类比
类似自动驾驶感知模型通过模拟器生成多样化边缘场景来提升 RL 控制策略的鲁棒性,LLM 也需要自我生成多路径推理数据来避免过度拟合单一解法模式。
核心洞察
- **将波利亚启发式解题策略转化为自监督数据生成框架,实现推理路径的结构化扩充。** 传统 RLHF 管道中,SFT 数据通常只包含单一标准解答,限制了模型对多角度推理的覆盖,导致策略梯度更新时无法有效采样多样性的正确轨迹。该工作通过编排波利亚的多种问题解决启发式(类比、分解、逆推等),引导模型自生成涵盖不同推理风格的高质量解答变体,在 mid-training 阶段即注入丰富的解题模式分布。这区别于仅依赖 prompt 工程或奖励塑形来鼓励探索的方法,它直接改变了策略初始化的行为分布,使得 RL 阶段的梯度信号能更频繁地关联到多种有效动作序列,从而稳定并加速收敛。
- **中训练(mid-training)作为预训练与 RL 之间的关键桥梁,用自生成数据重塑模型先验以缓解 RL 的探索困境。** 直接在 RL 阶段引入复杂推理任务时,若模型缺乏对多种有效策略的初始覆盖,策略梯度易陷入局部最优或高方差。本文通过在预训练基座和 RL 微调之间插入一个自举式中训练阶段,让模型先密集接触并模仿自身生成的多路径解答,本质上是一种策略蒸馏或行为克隆的变体。与在线 RL 时动态生成数据或单纯增加 SFT 数据量相比,这种中期干预能以较低成本大幅提升模型对奖励信号的响应效率,并在数学推理之外的 OOD 任务(代码、叙事)上表现出稳健迁移,验证了结构化中期数据注入对 RL 泛化的独特价值。
方法
方法流程
输入: 基础语言模型与初始训练数据(例如数学推理问答对)。
核心模块: 自举式数据生成与中间训练。
多样化自生成数据构建
- 以 Polya 问题解决启发式(理解问题、制定计划、执行计划、回顾)为指引,对初始数据中的每个问题,引导当前模型生成多个不同推理路径的正确答案变体。
- 具体利用
temperature采样与提示工程,确保生成答案在思路、步骤或中间结果上各异,但最终答案均正确。 - 该过程形成 自举数据(bootstrapped data),无需人工标注,完全由模型自我扩增。
中间训练(Mid-Training)
- 在强化学习(RL)之前,使用上述自生成数据对模型进行监督微调(SFT)。
- 目标:让模型充分暴露于多角度的解题策略,习得更广的推理行为分布,为后续策略梯度更新提供更好的初始化。
理论动机
- 从策略梯度视角分析,当模型已通过中间训练掌握多种解法时,RL 的梯度更新会更倾向于组合这些方法,而非重新探索,从而提升样本效率与最终策略质量。
强化学习训练
- 以中间训练后的模型为策略网络,采用奖励函数(如答案正确性)进行策略优化(例如 PPO)。
- 模型在数学推理任务上进一步强化,同时泛化到代码生成、叙事推理等 OOD 任务。
输出: 经过 RL 优化的语言模型,在多个基准(GSM8K、MATH 等)上取得一致提升。
与同类方法的差异点: 相较于直接 RL 或仅用原始数据微调,本工作在预训练和 RL 之间引入基于 Polya 启发的自生成多样化数据 的中间训练,通过扩展推理路径的广度来显著增强 RL 的最终效果,而非单纯依赖 RL 阶段的探索。
实验
实验设计
采用 中期训练 (mid-training) 后接 强化学习 (RL) 的两阶段框架。首先利用 波利亚解题法 指导模型为每个训练问题自生成多个不同推理路径的正确答案变体,构建多样化微调数据集;在此数据上对基座模型进行微调(即中期训练)。随后将微调后的模型作为 RL 训练的初始策略,在数学推理任务上使用策略梯度算法进行优化,并评估其在领域内数学基准及领域外代码生成、叙事推理任务的泛化能力。
关键发现
- 经过中期训练的模型在 RL 阶段后,在所有数学推理基准上均取得一致且显著的性能提升。
- 模型在 代码生成(如 HumanEval)和 叙事推理(如 CLUTRR)等分布外任务上也展现出更强的泛化能力,说明学习多样化解题路径有助于提升模型的鲁棒探索行为。
- 理论分析表明,策略梯度更新 会自然激励模型组合多种解题方法,而中期训练提供的多路径数据为此提供了先验,从而缓解了 RL 中奖励稀疏和探索不足的问题。
与基线对比
实验直接对比 有中期训练 + RL 与 无中期训练直接 RL(或仅用原始单一路径数据微调后再 RL)的模型。结果显示,仅用原始数据微调再 RL 的提升幅度明显弱于加入多样化自生成数据的方法,证实了数据多样性对 RL 效果的关键作用。这一发现与理论预期一致:暴露于多种解题方式的模型能更有效地在 RL 中组合策略,避免陷入局部最优。
行业影响
落地场景
- 在线教育平台:数学辅导与答疑系统可借助该技术,为同一道题生成多种正确解法,覆盖不同思维路径,适应学生个性化学习需求。
- 代码生成工具:编程助手在生成代码时,能输出多种实现方案(如不同算法、风格),辅助开发者选择最优解,提升代码质量与健壮性。
- 企业知识管理:对复杂业务问题(如金融风险评估、医疗诊断辅助)提供多角度分析,增强决策支持系统的说服力与可信度。
- 内容创作与审核:叙事推理能力的提升可用于故事生成、逻辑一致性检查,改善AI写作、剧本创作等产品的用户体验。
商业价值
- 降本:自生成数据显著减少人工构造多样化训练样本的成本,同时提升模型在RLHF阶段的数据效率,缩短整体训练周期。
- 增收:更强的推理泛化能力使模型能够处理更广泛的OOD任务,拓展产品边界,支撑更高附加值的付费服务(如专业领域问答、高级代码审查)。
- 体验提升:多元化解法呈现不仅提高答案准确率,还增强了可解释性与用户信任感,尤其在高风险场景(如投资建议、医疗咨询)中至关重要。
与现有产品/工作流的接口
该方法作为一个中训(mid-training)插件,可无缝嵌入主流LLM训练管道:
- 数据生成阶段:复用现有模型和提示工程,基于原始问题自动生成多解答变体,无需额外标注。
- 训练流程:在标准的SFT → RLHF流程中,插入一轮基于自生成数据的微调,代码改动小,适配现有分布式训练框架(如DeepSpeed、Megatron-LM)。
- 模型部署:产出的模型与常规RLHF模型完全一致,推理成本不增加,可直接替换线上模型。
具体用例:
- 教育科技公司构建交互式数学教练,当学生提问时,模型不仅给出答案,还展示“方程法”“几何法”“枚举法”等多种思路,并对比优劣,提升学习深度。该功能可直接集成到Web/App问答接口,后端模型通过中训增强后部署,前端展示适配多方案UI。
- 代码平台(如通用Copilot类工具)在生成代码片段时,同时提供“时间复杂度最优”“空间消耗最低”“代码可读性最强”三个版本,让开发者根据场景选择。该能力通过在中训阶段引入波利亚启发式生成多样代码实现,无需修改现有补全API。
局限
- 论文主要验证了自生成多解法数据对 RL 的增益,但**自生成的质量高度依赖基础模型**。若模型在生成阶段就偏向错误推理,生成的多样解法可能包含错误答案,从而在 mid-training 中引入噪声,反而损害 RL 的起点。作者仅在 Llama-2 等中等模型上实验,未讨论低能力模型的退化风险。此外,生成数据所用的启发式(基于波利亚方法)是人工设计的,**可能无法覆盖所有推理场景**,在更开放的叙事或常识推理任务中,多样性的定义和生成仍较模糊。
- 实验设计主要围绕数学推理(MATH、GSM8K 等)和有限的 OOD 任务(代码生成、叙事推理),**缺乏在通用 NLP 基准(如 MMLU、HELM)上的对比**,难以说明方法不会损害广泛能力。训练流程引入了额外的 mid-training 阶段,**计算开销明显增加**:数据生成需要多次采样及验证,且需要单独微调步骤,这在实际规模化部署中可能成瓶颈。文中未与使用更丰富 RL 数据或**迭代自博弈(self-play)类方法**(如 SPIN 等)公平对比,难以量化本方案在同类工作中的相对优势。
- 论文的理论分析基于简化的 bandit 设定,将 RL 政策梯度更新解释为鼓励组合多解法,但**真实 LLM 的策略空间远更复杂**,离散 token 生成与梯度估计的对应关系尚未充分讨论。多解法 mid-training 可能使模型倾向于生成更长推理链(利于数学题),但这是否导致在其他任务上产生冗余推理未做消融实验。此外,**只在 rewards model 为 ground-truth label 的简化环境下测试**,未扩展到人类偏好或更复杂的奖励模型,其泛化至真实 RLHF 场景的有效性有待验证。