Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space
RLVR(Reinforcement Learning with Verifiable Rewards) 能显著提升单样本准确率 (pass@1),却使策略的解空间收缩,削弱了 test-time scaling 的收益。本文追问:这种广度损失发生在推理轨迹的何处?是策略无法进入有效的解家族,还是进入后未能完成计算?为了区分“进入”与“执行”,我们选取 Countdown 任务,其解空间可按“首操作数与首运算符”被穷举为离散进入家族,并基于 Qwen2.5-3B 的 PPO 与 Qwen2.5-3B-Instruct 的 GRPO 展开分析。 实验显示,两种训练设置下,解覆盖最多下降 67%;即便在全程最优的检查点上,覆盖也减半。收缩高度集中于入口:首个算术运算前的 token 级似然偏移比后续推理大 11–16 倍。若仅补全未被选中的入口前缀,低进入家族的完成率可恢复一个数量级以上(PPO 下由 0.018 升至 0.212),证明替代解仍可执行,只是不再被发起。 定位到入口后,我们发现表面提示无法恢复多样性,而入口定向干预有效:早期检查点的晚期层参数插值在 pass@1 无损前提下将解覆盖提升 37%。进一步,早期熵塌缩在 7B/14B 模型的六个数学基准上普遍出现,但这并非推理优化的必然结果:SFT 基线保留的覆盖超过两倍,分阶段的 SFT→DPO→RLVR 流程也保住了早期熵。 总之,推理广度丢失在门口,而非室内。代码:https://github.com/ershiyidian/early-branch-locking。
论文精读
TL;DR RLVR 提升单样本准确率却收缩推理多样性,坍缩集中在首步操作入口而非后续执行;仅提供未选择的入口前缀即可大幅恢复完成率,参数插值干预可在不损失 pass@1 下提升 37% 解空间覆盖。
问题
问题背景
RLVR (Reinforcement Learning with Verifiable Rewards) 已成为提升推理模型单样本准确率 (pass@1) 的主流训练范式,但业界逐渐发现:准确率提升往往伴随解空间收缩,削弱 test-time scaling 的采样收益。
现有方法局限
现有研究多停留在宏观度量:报告 pass@1 与解覆盖率之间的负相关,却未定位解空间收缩发生在推理轨迹的哪个阶段。缺乏这一机制认知,导致干预手段盲目:表层提示 (surface prompting) 无法恢复多样性,而激进的正则化又可能损伤准确率。此外,传统分析依赖整体熵或多样性指标,无法区分**“不能访问有效解族”** (access 失败) 与**“访问后不能执行”** (execution 失败),因此难以设计针对性缓解策略。
为什么这个问题难 / 重要
- 技术挑战:区分入口决策与下游执行需要对任务解空间进行穷举分区,并要求逐 token 似然偏移分析,在当前大规模推理模型上计算成本高、可解释性强。
- 业界关注:推理时扩展(如多采样、树搜索)依赖模型生成多样且有效的候选分支。若入口处多样性崩溃,即使下游计算能力仍在,test-time scaling 的边际收益也会骤降,直接影响推理服务成本与效果。
行业类比
类似代码生成模型在 API 选择上过度集中于某几个常见函数,导致后续代码实现虽然可行但结构单一;当配合搜索式推理(如多次采样后验证)时,这种入口处的多样性丧失会显著降低找到更优实现方案的概率。
核心洞察
- **入口决策锁定** 是 RLVR 导致推理多样性损失的核心位置。以往工作多报告整体解决方案覆盖率下降,但未定位损失发生的具体步骤。本文通过将 Countdown 解空间划分为离散入口家族,发现 per-token likelihood 在首个算术操作前的偏移幅度是下游推理阶段的 11-16 倍,证明策略在起点已收敛至少数分支。这一机制定位为后续针对性干预提供了精确靶点,区别于全局正则化或采样策略调整等粗粒度方法。
- **前缀注入实验** 揭示未选中的解并非不可执行,而是未被发起。仅提供未选择的入口前缀,低访问族群的完成率从 0.018 提升至 0.212(PPO),提升超过一个数量级。这表明策略内部仍保留执行路径,但初始决策概率分布已坍缩。与假设 RLVR 抹除整个解空间的传统认识不同,该结果证明干预入口即可恢复多样性,且无需牺牲 pass@1,为推理时多样性恢复提供了轻量级手段。
- **早期熵崩溃并非必然代价**。在六个数学基准上,7B/14B 规模模型均出现早期步骤熵下降,但 SFT 基线保持两倍以上的解覆盖度,且分阶段 SFT–DPO–RLVR 管线保留早期熵。这说明从预训练到 RLVR 的直接优化会放大入口锁定,而引入监督信号或分阶段训练可缓解。工程上,可通过 late-layer 参数插值(与早期 checkpoint 融合)在 pass@1 无损的情况下提升 37% 覆盖率,为训练策略设计提供了可操作的指导。
方法
方法围绕 RLVR 解空间缩小的定位与恢复 展开,输入为 Countdown 算术搜索任务及 PPO/GRPO 训练后的 Qwen2.5-3B 策略。
关键模块
- 解空间离散化:将 Countdown 任务的完整解空间枚举为离散的 entrance families(由第一个操作数和运算符定义),使得覆盖率可量化。
- 访问与执行分离:对所有检查点分别采样,计算 solution coverage(覆盖的入口家族比例)。通过
supply entrance prefix实验(强制给定一个未选中的入口前缀)测试模型能否继续完成计算,从而区分“无法访问某个解家族”与“无法执行已启动的计算”。 - 机制定位:对比训练前后每个 token 的似然变化,发现第一算术操作之前的 token 似然偏移是后续推理 token 的 11–16 倍;同时测量早期步骤的熵 collapse,并在六个数学基准上验证。
- 干预与恢复:表面提示不足以恢复多样性;采用 late-layer parameter interpolation(将当前模型后期层参数与早期 checkpoint 插值),使 solution coverage 提升 37% 而不损失
pass@1。此外,对比 SFT 基线和 SFT-DPO-RLVR 流水线,验证早期熵并非 RLVR 必然产物。
输出结论:推理广度在入口处丢失,而非推理过程中;通过入口定向干预可恢复解空间覆盖。
与同类方法差异:多数工作只关注 pass@1 或全局熵下降,本研究通过离散入口家族和前缀介入实验,首次将“访问”与“执行”解耦,并提供可操作、不牺牲精度的参数插值恢复方案。
实验
实验设计
作者在 Countdown 任务上枚举所有解空间,按首个操作数和运算符划分为离散 entrance family。分别在 PPO 训练 Qwen2.5-3B 和 GRPO 训练 Qwen2.5-3B-Instruct 两种 RLVR 设置下,跟踪 solution coverage、per-token likelihood 和早期熵;随后在 GSM8K、MATH500 等六个数学基准上验证 7B/14B 模型的泛化性,并对比 SFT、SFT-DPO-RLVR 管线。
关键发现
- RLVR 提升 pass@1 的同时,solution coverage 最高下降 67%,甚至在所有 checkpoint 都解出的问题上也减半。
- 收缩集中于入口处:首次算术操作前的 per-token likelihood 偏移比下游推理大 11x–16x。
- 仅提供未选择的入口前缀,低访问家族的完成率从 0.018 升至 0.212,证明执行能力未丢失,只是不再启动。
- 晚期层参数插值早期 checkpoint 使 coverage 增加 37%,且 pass@1 无损。
- SFT 基线保留的 coverage 是 RLVR 的两倍以上;分阶段 SFT-DPO-RLVR 管线可保持早期熵。
深度解读
结果表明 RLVR 的多样性损失是一种早期决策锁定,而非推理能力退化。表面提示无法恢复多样性,而入口定向干预有效。这对工程实践的直接启示:在采用 RLVR 后,需要监控早期 token 熵或 coverage,并考虑 checkpoint 插值、分阶段管线或前缀注入等策略来保留测试时扩展的潜力。
行业影响
落地场景
RLVR 训练已广泛应用于数学推理、代码生成等可验证奖励任务,但该研究发现其导致解决方案空间在入口(首个操作符/操作数)大幅收窄,覆盖率最高下降 67%,直接削弱 test-time scaling 收益。典型应用场景:
- AI 编程助手:需要生成多种算法思路(如不同排序策略),而非单一模式;
- 数学教育产品:自动解题需展示一题多解;
- 金融量化策略生成:探索不同因子组合,避免策略同质化;
- 药物发现:分子生成需多样化候选。
商业价值
- 降本:恢复多样性后,相同采样预算下找到正确解的概率更高,可直接减少 API 调用次数与算力消耗;
- 增收:提升复杂任务完成率(例如代码修复、数学辅导),增强产品竞争力;
- 体验提升:用户获得更丰富的解释或备选方案,提高信任与粘性。
论文量化结果:仅注入未选中的入口前缀,低访问率族的完成率从 0.018 提升至 0.212;晚期层参数插值使覆盖率提升 37% 且 pass@1 无损失。
与现有产品/工作流的接口
- 训练侧:在现有 RLVR 流水线后期,采用参数插值(混合早期 checkpoint)或入口前缀注入,无需重新训练即可恢复多样性;
- 推理侧:在采样阶段显式控制初始分支(如强制不同首个运算符),结合树搜索或多数投票,实现更高多样性的 test-time scaling;
- 工程落地:开源代码 early-branch-locking 提供入口定位与干预实现,可集成至现有推理框架(如 vLLM、SGLang)的采样策略中。
局限
- 论文的主要机制分析基于 **Countdown 任务**,该任务解空间可通过**首操作数和运算符**进行离散划分,但这一结构性特征可能无法直接泛化到更开放域的数学推理(如 MATH、GSM8K 等)。虽然作者在六个数学基准上验证了早期熵崩溃现象,但核心干预实验(参数插值)主要在 Countdown 上完成,其在其他任务上的有效性仍待验证。此外,实验模型规模局限在 3B–14B,更大规模模型上的表现尚不明确。
- 提出的**入口定向干预**(entrance-targeted interventions)通过将后期检查点与早期检查点进行**参数插值**来恢复解决方案覆盖率,但该方法要求访问训练过程中的历史检查点。在外部使用者无法获得中间检查点或训练不稳定的场景下,该方法难以直接应用。同时,插值系数的选择需要针对特定任务和模型调优,论文未给出自动选择策略,实际工程落地成本较高。
- 与已有多样性保持方法(如温度采样、熵正则化、多目标优化等)的对比有限,论文主要与**表面提示**(surface prompting)进行了比较,未系统评估其他常见方法在同样设置下的效果,因此尚不清楚参数插值是否优于或互补于更简单的推理时干预。此外,在真实推理场景中,**早期步骤熵**的测量可能受到解码策略和温度的影响,论文在固定解码设置下得出的结论可能需要更多鲁棒性检验。