在 LLM 的 RL 中通过 Never Give Up 学会解决难题
我们证明,用 RL 训练 LLM 在数据集上的性能提升并不均等:对于 LLM 已经擅长求解的简单问题,RL 带来大幅提升;而对于难题 则提升很小。我们称这一现象为 RL for LLMs 中的 Matthew Effect,它呼应了经济学与网络科学中「富者愈富」的累积优势。最朴素的解释是难题需要更多算力才能找到解;但我们认为,现代 RL 方法在简单问题上浪费了过多算力,反而加剧了该问题,应当动态地重新分配算力。 为此我们提出 Never Give Up(NGU),一种简单的自适应采样 方法:对同一问题持续生成样本,直到其中出现一个正确解。借助异步 RL,它天然会用更少的样本过滤掉简单问题,并把更多算力投入到更难的题目上。我们还考察了影响 NGU 的设计选择,例如 off-policy 鲁棒性,并据此总结出一套最佳实践。 在数学基准 Deepscaler 上,NGU 提升了单位算力下的性能,在更难的题目上尤为明显。在近期的编程任务 Manufactoria 上,使用 per-test reward 的标准 GRPO 无法完整求解那些同时包含简单与困难测试的问题;而 NGU 能迭代改进,逐个攻克越来越难的测试,最终学会完整求解编程问题。
论文精读
TL;DR RL训练LLM存在马太效应:简单题提升大,难题提升小。本文提出 Never Give Up (NGU),持续采样直到答对,动态重分配算力至难题,在数学与编码任务上提升困难问题性能和算力效率。
问题
问题背景
RL for LLMs 正成为提升推理能力的核心路径,尤其在数学与代码任务上,业界期望通过 RL 扩展模型解决复杂问题的能力。
现有方法局限
当前主流 RL 方法(如 GRPO) 对每个 prompt 采样固定数量的 rollout,例如统一采样 8 或 16 条。这导致:
- 计算浪费在简单问题上:模型已经稳定答对的 prompt 仍被反复采样,产生低梯度方差且冗余的更新。
- 困难问题欠采样:需要大量探索才能找到正确解的困难 prompt,受限于固定采样预算,无法获得足够的正确样本支撑学习。
- 课程学习需要人工先验:预先定义难度顺序,无法适应模型实时能力变化,且难度标注成本高。
为什么这个问题难/重要
困难问题的奖励稀疏、正确解路径长,需要更多探索才能找到有效轨迹。固定采样策略面对异构难度分布,无法根据模型当前状态动态分配计算。这直接导致 Matthew Effect:容易的问题提升快,困难的问题提升慢,整体 benchmark 性能被简单样本主导的梯度信号拉偏。随着模型规模增大,单位计算效率成为关键约束,解决计算分配问题对 RL 在大规模推理任务上的落地至关重要。
行业类比
类似推荐系统中长尾物品的冷启动问题:固定曝光策略会让热门物品越来越强,而长尾物品因缺乏有效反馈始终无法改进,需要自适应分配曝光才能提升整体生态。
核心洞察
- 马太效应在 RL for LLMs 中本质是计算资源错配:标准 RL 对每个 prompt 均匀采样,简单题浪费大量样本,难题却因采样不足难以获得正奖励信号。NGU 通过异步 RL 动态重分配计算,只对未解出的题目持续采样,相当于给难题自动增加有效梯度步数,而不是简单的 hard example mining 或 curriculum learning。这为工程实现提供直接启示:放弃固定 batch 的 prompt 采样,改为基于成功状态的动态调度,能显著提升算力效率。
- NGU 区别于 curriculum learning:课程学习按人为难度排序渐进训练,而 NGU 让模型通过“是否已解出”这一信号自主决定何时停止采样,把探索与利用自然结合进 RL 循环。其关键设计是保留之前 completions 的 off-policy buffer,使多轮采样后的正确轨迹可被梯度利用,这要求训练算法具备 off-policy robustness,与 GRPO 等在线方法的核心差异也在于此。工程上需特别注意异步更新下旧策略样本的校正策略,避免性能回退。
方法
输入
- 每个训练步从数据集采样一批
prompt,以及初始策略模型(LLM)和可验证奖励函数(如数学答案正确性、代码测试通过率)。 - 传统 RL 方法(如 GRPO)对每个
prompt固定采样N条 completion,忽略 prompt 间难度差异。
关键模块
- 动态采样循环:对每个
prompt不再固定采样数量,而是持续生成 completions,直到至少出现一条获得正向奖励(正确)的样本,然后停止该 prompt 的采样。 - 异步 RL 调度:不同 prompt 的采样过程异步并行,简单 prompt 很快找到正确解并释放算力,难 prompt 持续占用采样预算,自然实现计算从易到难的重分配。
- 状态维护与 off-policy 处理:
NGU跟踪每个 prompt 的历史 completions 和正确/错误计数,避免对简单 prompt 重复采样,同时积累 off-policy 数据用于训练。作者强调需要关注 off-policy robustness,例如通过重要性采样或策略截断来稳定更新。 - 与固定采样对比:固定采样会让简单问题占据大量梯度更新,而 NGU 改变了样本分布,使难题在训练批次中贡献更高比例的更新步。
输出
- 每个 prompt 产生梯度信号,但难题因采样次数更多而对策略更新贡献更大,整体模型在困难问题上的性能显著提升。
- 在 Deepscaler 数学基准上,同等计算预算下 NGU 改善了难题性能;在 Manufactoria 编码任务上,NGU 逐步解决更难的测试用例,最终完全攻克任务。
作者论断:NGU 的本质是“不为简单 prompt 重采样”,通过在线判断和异步调度,把计算浪费从易题转移到难题。
与同类方法差异:与需要预定义难度顺序的课程学习或忽略 prompt 间难度差异的固定采样 RL 不同,NGU 完全由奖励信号在线驱动计算分配,无需先验难度标签,且原生适配异步训练框架。
实验
实验设计
论文在三个基准上验证 Never Give Up (NGU):数学基准 Deepscaler、编码任务 Manufactoria、以及额外数学验证集 GSM8k。在 Deepscaler 上对比标准 RL(如 GRPO)与 curriculum learning,重点考察 per-compute 性能以及 easy/hard 问题的权衡;在 Manufactoria 上使用 per-test reward 的 GRPO 作为基线,检验 NGU 能否逐步攻克更难的 test;GSM8k 用于扩展验证。
关键发现
RL 训练呈现 Matthew Effect:简单问题性能提升大,难题提升小。NGU 通过自适应采样——对同一 prompt 持续采样直到产生正确答案——减少在简单题上的算力浪费,将更多 compute 转移到难题上。在 Deepscaler 上,NGU 提升了单位算力下的性能,尤其在难题上表现更好;在 Manufactoria 上,NGU 能迭代解决越来越难的 test,最终完全解决编码问题,而标准 GRPO 无法做到。此外,NGU 也优于 curriculum learning 基线。
与基线对比解读
与固定采样预算的 GRPO 相比,NGU 的核心差异是动态采样分配:利用异步 RL 在简单题上提前停止,把算力集中到难题。这与 curriculum learning 的静态课程不同,NGU 是在线实时调整。对工程实践而言,这意味着在不增加总训练算力的情况下,通过改进采样策略即可提升长尾难题的性能,适合数据难度分布不均的场景。
行业影响
落地场景
NGU 适用于任何使用 RL 进行 LLM 后训练的产品线,尤其适合 数学推理、代码生成、Agent 任务 等难易样本混合且 reward 稀疏的场景。典型如电商客服中的复杂退换货政策推理、金融领域的多步计算问答、教育解题助手等。
商业价值
- 降本:NGU 通过减少 easy 样本的无效采样,将算力集中在 hard 样本,提升单位 compute 的性能,降低训练成本。
- 体验提升:模型在难问题上的准确率提升,直接改善高价值场景的用户体验,例如代码助手能正确生成复杂函数、客服能处理多约束咨询。
- 对推理成本无影响:NGU 只改变训练采样策略,不增加模型参数或推理开销。
与现有工作流接口
- NGU 可作为 采样策略插件 集成到现有异步 RL 框架(如 Ray/RLlib、vLLM 推理后端),仅需修改 rollout 逻辑。
- 兼容 GRPO、PPO 等主流算法,无需重构训练框架。
- 项目已开源 never-give-up,包含伪代码和实现细节,便于工程团队快速接入。
具体落地 use case
- 代码助手:使用 Manufactoria 类任务训练,NGU 可逐步解决更难测试,提升复杂代码生成能力。
- 金融研报问答:利用 Deepscaler 类数学推理,NGU 在难问题上获得更大提升,适合高价值金融分析场景。
局限
- **异步 RL 依赖与基础设施限制**:NGU 要求异步训练环境,能够根据每个 prompt 的采样结果动态决定是否继续生成。这在当前大多数同步 RL 框架(如标准 PPO/GRPO 实现)中需要额外改造,可能限制其即插即用性。论文提到异步 RL 是前提,但并未讨论在分布式同步训练中如何高效实现,也未给出计算预算控制策略。如果问题始终无法解决,NGU 可能无限增加采样,导致资源消耗不可控。实际部署时需要硬性上限或启发式终止条件,这会影响方法鲁棒性。
- **任务泛化性有限**:论文在数学基准 **Deepscaler** 和编码任务 **Manufactoria** 上验证,但这两个任务具有明确的逐样本正确性判定(答案对错/测试通过),而很多 RL 任务如开放域对话或偏好优化中奖励是连续且模糊的,NGU 的“一直采样直到正确”策略可能无法直接适用。此外,论文未与更先进的课程学习或优先级采样方法进行充分对比,仅在部分设置下与课程学习比较,因此其在更广泛任务上的优势尚不明确。
- **可能加剧分布漂移或偏差**:NGU 更频繁采样困难问题,可能改变训练数据分布,导致模型过度拟合少数极难样本,而忽略易题和中等题目的平衡。虽然目标是缓解 Matthew Effect,但过度集中于难题也可能造成新的不平衡,尤其是在有限训练步数下。论文没有报告模型在原始分布上的性能退化情况,也没有讨论如何校正采样权重以避免灾难性遗忘。