通过随机选择的少量示例引导提升基于可验证奖励的强化学习
基于可验证奖励的强化学习 (RLVR) 在数学和编码等任务中通过链式思维生成发展大语言模型 (LLMs) 方面取得了显著成功。然而,在正确 rollout 难以生成的困难问题上,RLVR 面临样本效率低下的挑战。先前工作通过演示引导的 RLVR 解决该问题,即在 RL 失败时进行监督微调 (SFT);但 SFT 通常需要大量数据,获取成本高昂。 本文提出 FEST,一种少量示例演示引导的 RLVR 算法,仅需从 SFT 数据集中随机选取 128 条演示即可取得令人瞩目的结果。我们发现三个关键组件至关重要:监督信号、在线策略信号以及对少量 SFT 数据集施加衰减权重以防止多轮训练过拟合。 在多个基准测试上,FEST 以数量级更少的 SFT 数据超越基线方法,甚至在使用完整数据集时也能匹配其性能。
论文精读
TL;DR FEST 仅用 128 条随机示范,通过监督信号、在线策略信号与衰减权重,大幅提升 RLVR 在难问题上的样本效率。
问题
问题背景
当前大语言模型(LLM)的推理能力训练已从RLHF转向RLVR(Reinforcement Learning with Verifiable Rewards),尤其在数学和代码等可自动验证的任务上。RLVR 利用客观奖励信号(如单元测试通过率、答案匹配)替代主观偏好,推动了 o1、DeepSeek-R1 等模型的成功。然而,样本效率仍是核心瓶颈:面对高难度问题,模型难以生成正确 rollout,导致 RL 训练回报稀疏、收敛缓慢。
现有方法局限
为解决 RLVR 的冷启动困难,现有工作普遍采用demonstration-guided RLVR:在 RL 失败时穿插SFT(Supervised Fine-Tuning),用高质量示例引导模型。典型方法如 ReST、SPIN、RFT 等,但这类策略存在明显局限:
- 数据依赖性强:SFT 阶段往往需要数万条人工标注或蒸馏数据,获取成本高昂;
- 训练不平衡:SFT 与 RL 阶段相互独立,难以协同优化,甚至引发策略退化;
- 过拟合风险:在小样本下反复训练 SFT 会快速拟合噪声,丧失泛化能力。
为什么这个问题难且重要
从 AI 工程视角,解决少量示例下的高效 RLVR 是落地的关键:
- 技术挑战:需要同时注入正确的监督信号(expert demonstrations),又必须保持策略在线(on-policy)以避免分布偏移;还要抑制小数据集上的过拟合。三者之间存在矛盾,简单的数据混合或阶段交替无法兼顾。
- 业界关注度:推理模型的迭代成本直接决定产品化速度。若能用极少示例(例如仅 128 条)达到接近全量数据 SFT 的效果,将极大降低数据采集与训练开销,加速垂域模型适配。
行业类比
类似在低资源代码补全场景中,仅凭数十个示例片段就能让模型学会遵循特定的 API 风格并自我纠错——FEST 算法相当于将这种 few-shot 引导能力内置到了 RL 训练循环中。
FEST 的核心发现是:结合 supervised signal(交叉熵损失)、on-policy signal(RL 梯度)和 decaying weights(指数衰减 SFT 权重)这三个组件,可在 128 个随机挑选的示例上超越传统大量数据训练的基线。
核心洞察
- **小样本演示引导(Few-Shot Guidance)突破 RLVR 样本效率瓶颈**: RLVR 在困难问题上因难以生成正确 rollout 而样本效率低,现有方案依赖大量 SFT 数据,成本高昂。FEST 仅需从 SFT 数据集中**随机选取 128 条演示**,即能匹配甚至超越使用全量数据的基线。这一发现颠覆了“SFT 数据越多越好”的直觉,表明在 RLVR 框架下,**极少量高质量信号即可有效驱动探索**,大幅降低数据获取成本。
- **三组件协同(监督/在线策略/衰减权重)是避免灾难性遗忘与过拟合的关键**: 与简单的 SFT+RL 混合不同,FEST 显式设计了三个控制维度:**监督信号**提供稳定方向,**在线策略信号**保持探索与策略一致性,**衰减权重**防止在 SFT 小数据集上多轮训练导致过拟合。这种解耦设计让模型既能从演示中快速汲取知识,又不牺牲 RL 自身的探索能力,对工程上平衡**利用(exploitation)与探索(exploration)**具有直接参考价值。
- **FEST-GRPO 缓解梯度失配,强化策略梯度方法的兼容性**: 主流 RLVR 算法(如 GRPO)在结合演示时可能出现**梯度方向冲突**,影响收敛。FEST 提出 FEST-GRPO 变体,通过调整损失项权重或优化目标,缓解了监督损失与策略损失之间的梯度失配。这一改进确保了演示信息能真正提升策略,而非干扰 RL 过程,为在已有 RL 管线中嵌入少样本引导提供了安全、即插即用的方案。
方法
输入
FEST 的训练流程起始于一个预训练的 LLM(如 DeepSeek-R1 基础模型)、一个 RLVR 环境,以及一个从标准 SFT 数据集中 随机选取的 128 条少样本演示。每条演示包含问题(prompt)与正确的链式思维推理(CoT rollout)。在 RLVR 阶段,模型对每个数学或编程问题采样多条推理路径,并由可验证奖励(如答案匹配或单元测试)自动评估正确性。
关键模块
- 有监督信号:将选出的 128 条演示直接用于 SFT,为模型提供稳定且高质量的初始化信号,确保它在 RL 探索开始前掌握基本的推理模式。
- 在线策略信号:在 RL 训练中,使用当前策略(on-policy)生成的样本计算优势函数,并通过 GRPO(Group Relative Policy Optimization) 等算法更新模型。这一信号鼓励模型自主发现未被演示覆盖的正确推理路径,尤其对于困难问题至关重要。
- 衰减权重机制:由于仅用 128 条数据需训练多个 epoch,直接 SFT 极易过拟合。FEST 对 SFT 损失项施加指数衰减权重(随训练步数减少),使模型逐渐从依赖静态演示转向适应在线策略反馈,有效平衡监督与探索。
- FEST-GRPO 梯度修正:针对 RLVR 中常见的梯度不匹配问题(策略梯度与真实奖励梯度方向不一致),FEST-GRPO 引入对采样分布的约束,缓解了策略坍缩,进一步稳定训练。
输出
经过交替或联合优化的训练后,FEST 产出一个在目标推理任务(如 MATH、GSM8K、HumanEval 等)上表现显著提升的 LLM。它不仅复现,甚至超越了使用全量 SFT 数据训练的方法,而所用数据量减少了数个数量级。
与 ReST EM、SPIN 等完全依赖大规模 SFT 数据的演示引导 RLVR 方法不同,FEST 仅需极少随机演示,并通过“有监督预热 + 在线策略探索 + 动态权重衰减”的三组件设计,在样本效率与最终性能之间取得了突破性平衡。
实验
实验设计
FEST 在数学推理和代码生成基准上进行评估,使用极少量演示(仅 128 个随机示例)引导 RLVR 训练。基线包括常规 RLVR 和重 SFT 方法。
- 监督信号、on-policy 信号与衰减权重是 FEST 成功的三个关键组件。
- 数据从 SFT 数据集随机采样,而非精心挑选,降低了数据获取难度。
关键发现
- 极高数据效率:仅用 128 个示例,FEST 性能超越使用全量 SFT 数据的基线,甚至匹配全量性能。
- 组件缺一不可:消融实验证实三个组件任一缺失都会导致性能下降。
- 跨数据集一致性:在不同规模的数据集上均观察到稳健提升,表明方法通用。
基线对比解读
与 SFT 重训相比,FEST 在大幅减少数据下实现了同等或更优结果;与 纯 RLVR 相比,FEST 解决了困难样本的数据效率问题。这为实际工程中昂贵的数据标注提供了低成本替代方案,同时保持了模型的对齐效果。
行业影响
落地场景
FEST 大幅降低了 RLVR 对高质量示范数据的依赖,适用于任何依赖可验证奖励的 LLM 推理场景。典型产品包括:
- 教育科技:数学解题辅导、编程作业批改,需精确验证答案但不一定有大量标注过程。
- 开发者工具:代码生成与补全、自动化测试用例生成,可利用单元测试作为可验证信号。
- 金融分析:数值推理、报告生成,可由逻辑规则或计算正确性校验。
- 企业知识库问答:需多步推理的合规审查或问题解答,答案可被标准流程验证。 少量随机示范即可启动强化学习,让冷启动或数据稀缺的垂直领域快速搭建高性能推理模型。
商业价值
核心降本逻辑:数据标注成本大幅压缩。传统 SFT 需上万条精心标注的推理链,FEST 仅需 128 条随机示例,数据获取开销降低 1-2 个数量级。
- 降本:减少对昂贵人工标注的依赖,训练环节的硬件成本因样本效率提升而降低。
- 增收:更快的模型迭代速度使产品能率先覆盖长尾需求,提升用户留存与付费转化。
- 体验提升:通过 on-policy signal 和 decaying weights 抑制过拟合,模型在少量示例下仍能保持泛化,输出与人类偏好对齐度高,减少“幻觉”或机械复制。
与现有产品 / 工作流的接口
FEST 可作为插件式模块嵌入现有 RLVR 训练 pipeline,无需重构基础设施:
- 训练框架:与主流 RLHF/RLVR 库(如 TRL、DeepSpeed)兼容,只需在损失函数中加入监督信号项,并配置余弦衰减权重调度。
- 数据 pipeline:只需从 SFT 数据集中随机采样极小子集,无需额外清洗或重标注。
- 在线部署:模型输出格式不变,推理服务无需修改;可用少量示范定期微调线上模型,实现持续优化。
具体落地案例
- 在线编程学习平台(如 LeetCode 风格练习):用户提交代码后,LLM 给出解题思路或错误分析。RLVR 奖励信号基于单元测试是否通过,但正确思路生成困难。引入 FEST,仅用 128 道经典题的官方题解作为随机示范,即可显著提升助手生成推理链的准确率,且无需人工编写大量分步解题过程。
- 企业 IT 运维自动化:异常检测告警后的根因分析与修复建议生成。奖励可定义为修复脚本执行成功,但多数告警无现成指导。用少量已解决问题作为示范,FEST 能让 RLVR 快速学会通用排查逻辑,缩短平均修复时间 (MTTR)。
局限
- - **随机选择策略的鲁棒性**:FEST 的核心是使用从 SFT 数据集中随机采样的 128 个 demonstration 作为引导。尽管实验显示随机选择即能取得良好效果,但实际工程部署中,随机采样的结果波动可能较大,且未考虑样例的多样性、难度分布或针对特定模型的适配性。如果原始数据集存在偏置或噪声,少量随机样例可能引入不一致的监督信号。论文未系统对比其他采样策略(如基于不确定性的主动选择、离线 reward 排序或聚类代表性选择),也未分析小样本条件下不同种子对最终性能的敏感性,这给生产环境下的稳定复现带来潜在风险。
- - **任务泛化与超参数敏感度**:现有实验集中于数学推理(如 MATH、GSM8K)和代码生成任务,这些任务拥有明确、可自动验证的奖励函数。对于奖励信号不易形式化的开放性任务(如长文本规划、创意写作、多轮对话),FEST 的有效性缺乏验证。此外,方法中引入的 **decaying weights** 机制用于抑制多轮 SFT 过拟合,但其衰减系数 `β` 可能需要针对新任务重新调节,同时 on-policy 信号的权衡权重也会影响训练稳定性。这种跨任务的超参数敏感性增加了将 FEST 移植到新领域时的调优成本和算力开销。
- - **与全数据方法的工程取舍**:虽然 FEST 以极少量数据(128 条)可达到与全量 SFT 数据集(通常数万条)近似的性能,但在某些困难子问题上,随机选出的 demonstration 可能无法覆盖关键模式,导致性能下降。论文的消融实验验证了三大组件的必要性,但未深入探讨当 demonstration 数量进一步减少或选到“坏样例”时,on-policy RL 是否能够完全弥补监督信号的缺失。在工业级追求极致性能的场景中,额外的数据采集和筛选成本可能仍然值得,FEST 所倡导的极致节省数据的策略可能需要在性能和成本之间重新权衡。