为什么 Reasoning Models 会失去覆盖率?数据与 Forks in the Road 的作用
近期大型语言模型的进展催生了推理模型 (reasoning models),这些模型通过专门的微调流程在复杂任务上表现出色。尽管这些方法可靠地提升了 pass@1 准确率,但先前的研究观察到它们会出现覆盖收缩行为 (coverage shrinkage),即 pass@k 相对于基模型下降。本文研究了基于 SFT 的后训练中推理收缩的产生原因。我们假设该行为由微调数据的属性驱动,特别是与“决策点”或“岔路口”(forks in the road) 场景相关,其中模型面临多个有效推理路径的不清晰模式。 为了验证假设,我们设计了受控案例研究,模拟决策点设置,涵盖图分支中的不清晰节点以及推理模式。通过追踪这些设置的后训练动态,我们发现收缩现象与训练数据中决策点场景的普遍性紧密相关。我们还证明了这种收缩行为可以通过针对性的决策点数据合成设计以及更系统的鼓励多样性的解码机制来部分缓解。 我们的发现确定了以数据为中心的因素是推理模型收缩的关键驱动因素,并强调了多样性感知设计作为控制收缩的有效杠杆。
论文精读
TL;DR 推理模型在 SFT 后训练时出现 pass@k 覆盖度坍缩,根因是训练数据中的“分岔决策点”诱导模型过度依赖伪特征,论文通过可控实验验证并给出数据多样性设计与解码干预的缓解策略。
问题
问题背景
随着大语言模型在复杂推理任务上的应用,业界越来越关注推理模型(reasoning models)通过 SFT 监督微调(Supervised Fine-Tuning)提升pass@1 准确率的做法。然而,近期研究观察到一种“覆盖率收缩”(coverage shrinkage)现象:尽管 pass@1 提升,模型在多次采样下的pass@k 指标反而下降,即生成正确答案的可能性变低了。
现有方法局限
目前主流的后训练方案(如基于蒸馏或 RLVR 的微调)几乎完全聚焦于单次生成的最优性,忽视了模型输出分布的多样性。这种做法的技术局限在于:
- 微调数据中常包含具有多个有效推理路径的决策点(forks in the road),但训练目标强制模型收敛到其中一条路径,导致模型对其他同样正确的分支“视而不见”。
- 缺乏对数据中歧义模式(indecipherable patterns)的显式建模,使得模型在遇到需要分支选择的场景时,过度依赖浅层统计线索(spurious cues),而非真正理解任务结构的多样性。
为什么这个问题难/重要
推理模型的部署场景往往要求高覆盖度与高鲁棒性:例如在数学证明、代码生成、科学推理等开放式问题中,正确答案可能对应多种不同的推理路径。一旦模型在微调后丧失覆盖能力,将导致:
- 对输入微小扰动敏感,易陷入单一思维模式;
- 在需要“探索-回溯”的任务中过早收敛到次优解(over-thinking 与 under-thinking 并存);
- 限制模型在交互式应用(如辅助决策)中的可靠性,因为仅靠提高 pass@1 无法保证用户总能通过多次提问得到正确答案。
从技术挑战看,平衡准确率与多样性是典型的“探索-利用”困境,且受数据构造方式深刻影响,因此是数据驱动 AI 工程中的核心难题。
行业类比
该问题类似于代码辅助工具中的算法补全:若模型仅记住教程中最常见的 O(n²) 解法,而忽略同场景下更优的 O(n log n) 实现,则面对大规模数据输入时直接失效,丧失了作为智能助手的实用价值。
核心洞察
- 推理模型的覆盖收缩源于训练数据中“分叉路口”场景的决策偏好固化,而非灾难性遗忘或优化目标偏差。该工作首次以数据为中心,通过图分支和推理模式两类可控实验,定量关联收缩程度与决策点密度,区别于以往仅从解码算法或微调方法找原因的研究,为诊断和缓解shrinkage提供了新的归因框架。
- 针对性合成多样性决策点数据可部分逆转覆盖收缩,且数据设计比解码端多样性机制更直接有效。论文不仅揭示问题,还验证了数据侧干预的可行性与局限性,强调未来后训练需平衡准确率提升与覆盖保持,对构建稳健推理系统的数据策划有明确指导意义。
方法
本研究提出一种数据为中心的分析框架,用于解释推理模型在监督微调(SFT)后出现的覆盖收缩(coverage shrinkage)现象。
输入与假设
以基础模型和微调数据集为输入,核心假设是:数据中存在大量**“岔路口”决策点**(forks in the road)——即模型面临不可分辨的多个有效推理路径时,会因学习到伪相关(spurious cues)而过度偏向单一模式,导致pass@k下降。
关键模块:可控案例研究
为验证假设,设计两类受控合成实验:
- 图导航任务:在图中构造不可区分的分支节点,追踪模型如何学会基于伪特征(如节点命名模式)而非图结构选择路径。
- 推理模式选择:对比自然语言推理与代码推理,或线性推理与回溯推理,观察SFT后模型对特定模式的“锁定”倾向。 通过监控不同训练阶段的pass@k动态,量化决策点占比与收缩程度的关联。
输出与缓解策略
实验表明,决策点密度是覆盖收缩的核心驱动因素。基于此提出两种缓解方案:
- 数据多样性设计:在合成数据时,对决策点引入更多样的路径选择,避免单一模式主导。
- 多样性鼓励解码:通过操纵首token分布(first-token manipulation)或采用多样性解码机制(diversity-encouraging decoding),在推理时保持多条路径的覆盖率。
差异点
与现有工作关注优化目标或模型架构不同,本研究首次从数据构造的“歧义性” 角度系统剖析覆盖收缩的成因,并给出可操作的数据与解码干预手段。
实验
实验设计
为验证 coverage shrinkage 与决策点(“分岔路口”)的关联,作者设计了两类受控合成实验:
- 图导航任务:图中包含分支结构,部分节点提供不可区分的线索,迫使模型面临选择;
- 推理模式选择任务:构造自然语言推理 vs 代码推理、线性推理 vs 回溯推理等场景,监测模型在不同模式间的分布变化。 在 SFT 后训练 中动态跟踪 pass@1 准确率 与 pass@k 覆盖率(从多次采样中至少得到一次正确答案的概率),并分析决策点频次与收缩现象的相关性。
关键发现
- 决策点密集的训练数据直接导致 coverage shrinkage:当数据中存在大量模型无法可靠区分的多个有效路径时,SFT 会使模型倾向于固守某一特定路径,牺牲多样性,导致 pass@k 持续下降。
- 收缩行为可在图分支与推理模式两类设定中复现:在自然语言 vs 代码推理中,模型逐渐偏好代码;在线性 vs 回溯推理中,可能出现过度思考或思考不足,均印证了 data-centric 的因果机制。
- 缓解手段有效但有限:通过 定向合成更多样化的决策点数据 或采用 鼓励多样性的解码机制(如首 token 操控),pass@k 收缩可被部分抑制,证明多样性设计是调控收缩的关键杠杆。
与基线的深度对比
传统强化学习或 SFT 通常仅关注 pass@1 的提升,忽略 pass@k 的退化。本工作首次从数据层面归因:与单纯增加数据量或强化奖励相比,决策点的多样性与分布是决定覆盖率健康度的核心因素。不同推理模式实验进一步揭示,细粒度地控制数据中决策点的类型和比例,比一刀切的散粒度调控(如温度)更有效,为后续数据工程和高效解码策略提供了明确着力点。
行业影响
落地场景
推理模型覆盖收缩问题的解决方案可应用于代码生成平台、数学辅导工具、法律文书分析等需要高可靠性且多候选答案的场景。例如,代码助手在提供多个补全建议时,若所有建议均错误(低覆盖),则失去实用价值;通过确保候选集覆盖正确解,可显著提升采纳率。
商业价值
- 降低错误成本:在金融风控(如贷款审批)或医疗问答中,单一错误答案可能导致高风险决策。提高
pass@k意味着后端可从多个候选中筛选出正确结果,减少误判。 - 提升用户满意度:内容平台(如知识问答)提供多样化答案,用户感知更智能,减少“反复重试”的人工成本。
- 数据飞轮:利用多样性解码生成的高质量训练数据可反馈至模型,形成正向循环,降低人工标注需求。
集成方式
- 数据管道增强:在监督微调阶段,使用论文所提的决策点数据合成生成覆盖多种推理路径的训练样本,可与现有数据增强工具(如 Self-Instruct)结合。
- 推理引擎插件:将多样性鼓励解码(如操控首 token 分布)作为后端推理服务的可配置选项,在需要高覆盖场景时启用,无需重新训练模型。
具体用例
- 电商客服机器人:用户询问“我的订单为什么延迟?”,模型可能给出“物流异常”“库存不足”“地址错误”等不同原因。若训练数据中仅提供一种常见解释,模型遇到新情形时会过度拟合,导致所有候选答案指向同一错误。使用决策点数据多样化训练后,模型可生成覆盖多种原因的答案,客服系统从中选择最匹配的,大幅提升问题解决率。
- 编程竞赛辅助工具:面对一道算法题,模型可能使用动态规划或贪心策略。若训练数据中只包含动态规划解法,模型在遇到更适合贪心的问题时仍输出动态规划(但可能超时)。通过对决策点(选择算法模式)的数据进行多样化合成,模型在输出多个候选时能同时给出两种思路,供用户选择最优解,提升工具实用性。
局限
- 实验仅在合成的图分支和有限的推理模式选择(自然语言 vs. 代码、线性 vs. 回溯)上验证,未能覆盖真实复杂推理任务中更丰富的决策点类型(如数学证明策略、多跳问答中的证据选择等),结论的泛化性有待进一步检验。且缓解方案仅部分减轻了 coverage shrinkage,尚未能消除该现象,说明可能还有其他未被建模的因素在起作用。
- 提出的数据多样性设计和首次 token 操控策略与现有其他解码级多样性增强方法(如 temperature scaling、nucleus sampling、beam search 等)缺乏系统对比,难以评估其在推理模型后训练场景中的相对优势。同时,对合成决策点数据的生成方式依赖手动设计,自动化扩展至大规模真实语料的可行性未讨论。
- 评估主要依赖 pass@1 和 pass@k 指标,未探讨 coverage shrinkage 对模型在更细粒度推理行为(如中间步骤正确性、推理路径可解释性)上的影响,可能忽略了模型在浅层语义变化上的多样性退化。此外,研究基于 SFT 后训练范式,未涉及 RLHF、DPO 等对齐方法的 coverage 演变规律。