清华与腾讯提出GPS,用小模型预测难度减少大模型RL后训练成本
用小型预测模型提前筛选训练样本,大幅降低大模型强化学习后训练的计算成本。
大模型RL后训练中,每步需大量rollout(生成多条推理链),成本高昂。清华与腾讯提出GPS,先训练一个小型Prompt预测模型(评估当前难度),再据此挑选中等难度的prompt训练,并兼顾batch多样性。实验显示,相比随机采样,训练加速1.4-2倍;相比需真实评估的动态采样,最多减少69% rollout成本,训练时间减少28-47%。该预测模型还能复用于测试时计算分配。
正文摘录
.jpg)  RLVR 已经成为提升大模型推理能力的重要后训练路线。 在数学推理、代码生成和复杂逻辑任务中,模型会针对同一个 prompt 生成多条 Chain-of-Thought,再通过可验证奖励判断对错,并据此更新策略。 但这条路线有一个很现实的问题:成本高。每个训练 step 都需要大量 rollout,而这些 rollout 往往意味着反复调用大模型生成长答案。 那么,有没有可能不再 “平均用力”,而是让一个小模型提前判断:哪些 prompt 更值得拿来训练? 来自清华大学与腾讯的研究者提出了 Generalizable Predictive Prompt Selection(GPS) 。GPS 的做法很直接:先训练一个小型、可泛化的 Prompt Predictive Model(PPM),让它预测不同 prompt 在当前模型下的难度;再根据难度和 batch 多样性选择训练样本,从而减少无效 rollout。 实验显示,GPS 在数学推理和逻辑推理任务上都带来了明显收益:相比 Uniform 随机采样,训练步数加速达到 1.4×–2.0× ;