现成 LLM 作为过程评分器:数学推理中 PRM 的无训练替代方案
问题: 使用更强的评分器从多个小模型样本中选择最佳响应是一种简单的推理时策略,但当小模型已陷入错误推理路径时,该方法会失效。PRM 引导搜索 通过在生成过程中对候选续写进行评分来避免此问题,但需要经过步骤级标注训练的奖励模型。 方法: 我们提出 Chunk-Level Guided Generation,一种无训练替代方案,使用现成大语言模型作为过程评分器。每步中,小模型采样 k 个固定长度的候选块,大模型通过似然度(不生成文本)对这些候选块评分,然后选定块提交至下一步,从而在错误传播前引导生成。我们实例化两种选择规则:Likelihood-Guided Selection (LGS),选择大模型长度归一化对数概率最高的块;Contrastive-Guided Selection (CGS),减去小模型的对数概率,以偏好大模型与小模型偏好分歧的块。我们证明,用大模型似然度对变长推理步评分因系统性的长度偏差而不可靠(即使经过长度归一化亦然),而固定长度块可避免此混杂。 实验: 在 GSM8K、MATH、Minerva Math、AMC23 和 AIME24 上,使用 Qwen2.5-1.5B 由 Qwen2.5-32B 引导,以及 Llama-3.2-1B 由 Llama-3.1-70B 引导,CGS 相比多数投票(majority voting)提升高达 28 个百分点,且在匹配引导预算下,在大多数基准上达到或超越 Qwen2.5-Math-PRM-72B 引导搜索,无需训练奖励模型。使用 Qwen2.5-7B 由 Qwen2.5-72B 引导,CGS 在 MATH 上达到 81.8%,在 Minerva Math 上达到 63.6%(k=16),超越多数投票 4–6 个百分点。此外,Chunk-Level Guided Generation 生成的推理轨迹比 PRM 引导搜索 显著更短。
论文精读
TL;DR 用现成大语言模型作为过程评分器,通过选择固定长度候选块引导小模型逐步生成,无需训练奖励模型即可在数学推理上匹配或超越多数投票和 PRM 引导搜索。
问题
问题背景
在推理时扩展计算以增强小型语言模型的数学推理能力,已成为高效部署的关键方向。当前主流方案是在完整生成后进行多选一(如 best-of-N 或 majority voting),但这类后验选择无法在生成过程中纠偏。
现有方法局限
- 后验选择:小模型一旦进入错误推理路径,所有后续 token 均受污染,最终即使由强 scorer 打分也无法挽回,导致计算浪费且上限明显。
- PRM 引导搜索:通过过程奖励模型(PRM)在每一步对候选延续打分,能中途修正,但需大量步级人工标注来训练奖励模型,成本极高且泛化受限。
- 可变长度步评分偏差:现有利用大模型似然作为步级评分的工作发现,即使对对数概率做长度归一化,长步仍被系统性低估,使大模型直接评分不可靠。
为什么这个问题难且重要
技术核心挑战在于:
- 消除评分阶段的长度混淆——大模型对短 chunk 天然偏好,若不固定 chunk 长度,评分会失去校准。
- 无需训练过程奖励模型,直接利用现成大模型作为过程 scorer,既保留大模型的推理知识,又避免昂贵的标注和训练。
- 如何设计对比选择准则(如 CGS),使大模型的偏好与小模型形成互补,而不只是复用小模型自身的高概率选择。
业界高度关注,因为数学推理是衡量模型逻辑能力的硬指标,且该方法训练免费、部署轻量,可随大模型升级直接迁移,对实时推理系统(如 API 服务)极具吸引力。
行业类比
类似代码补全中,编辑器后台用强模型实时评估多个补全块,选出最符合上下文的片段即时插入,而非等整个函数体生成完毕再全局判断。
核心洞察
- **固定长度块(fixed-length chunks)** 消除了过程评分中的长度偏差。直接使用大模型似然评估变长推理步骤存在系统性偏差,即使长度归一化也无法消除,导致评分不可靠。本文强制将生成切分为等长 token 块进行评分,从根本上规避了这一混杂因素,使得现成大模型可以公平比较候选推理路径。
- **训练免费过程引导** 将现成大模型直接用作过程评分器,无需步骤级标签训练奖励模型。与 **PRM guided search** 不同,该方法在每一步让小模型采样 k 个候选块,大模型仅基于 likelihood 评分选择,完全避免了昂贵且依赖标注数据的奖励模型训练。在匹配的引导预算下,该方法在多数基准上匹配或超越专门训练的 **Qwen2.5-Math-PRM-72B**,验证了现成模型的过程评分潜力。
方法
核心思路:分块级引导生成 (Chunk-Level Guided Generation)
该方法将推理过程划分为若干固定长度的 候选块 (chunk),在每个步骤中用现成的大模型作为 过程评分器 (process scorer),无需额外训练奖励模型。
输入与执行流程
- 候选块生成:小模型 (small model) 根据当前上下文,采样
k个固定长度为L的 token 序列作为候选块(例如L=16)。 - 似然度评分:大模型 (large model) 直接计算每个候选块的 对数概率 (log-probability),不生成任何文本,仅作为评分信号。
- 块选择与提交:根据评分规则选出最优候选块,将其确定性地提交到解码序列中,小模型再基于更新后的上下文生成下一步候选,如此循环直至生成结束。
两种选择规则
- 似然度引导选择 (Likelihood-Guided Selection, LGS):选择大模型下 长度归一化对数概率 最高的候选块。
- 对比引导选择 (Contrastive-Guided Selection, CGS):从大模型对数概率中减去小模型的对应对数概率,选择差值最大的块,即在大模型偏好与小模型自身倾向出现分歧时,更信任大模型。
为何采用固定长度块?
对变长推理步骤直接评分存在 系统性长度偏差,即使进行长度归一化后仍不可靠。固定长度块消除了这一混淆因素,使得大模型的似然度评分能稳定反映块的质量,而非受长度影响。
与同类方法的差异
不同于 PRM guided search 需要步骤级标签训练奖励模型,本方法完全免训练,直接利用现成大模型;相较于 Majority Voting 只能在生成完成后选择,分块引导在推理途中即可纠偏,避免错误累积。
实验
实验设计
- 模型对:测试了小模型(1.5B/7B)由大模型(32B/70B/72B)引导的组合,涵盖 Llama 与 Qwen2.5 家族。
- 对比基线:多数投票(Majority@k)、Best-of-N、Self-Certainty、Borda count,以及需训练的 PRM 引导搜索(Qwen2.5-Math-PRM-72B)。
- 可控变量:固定 chunk 长度 L、每步候选数 k、引导预算(大模型调用次数)。在 5 个数学推理基准上评估准确率与推理链长度。
关键发现
- 去偏打分:变长步骤的似然打分存在系统性长度偏差,即使长度归一化也无法消除;定长 chunk 彻底规避了该混淆。
- CGS 优于 LGS:对比选择(CGS)通过减去小模型 log-probability,聚焦大模型与小模型偏好分歧的 token,效果更好。
- 跨模型泛化:CGS 在不同模型对和基准上一致提升多数投票,最高提升 28 个百分点(Llama-3.2-1B → 70B,GSM8K)。
- 匹配或超越 PRM 搜索:在同等引导预算下,CGS 无需任何奖励模型训练,性能与 Qwen2.5-Math-PRM-72B 相当或更优(Minerva Math 上 39.0% vs 32.4%)。
- 扩展性:当小模型增至 7B(Qwen2.5-7B → 72B),MATH 达 81.8%,Minerva Math 达 63.6%,推理链长度反而短于 PRM 搜索。
与基线对比深度解读
多数投票等后验选择方法无法修正已生成路径的错误,因为所有候选项都源自同一错误方向。PRM 引导搜索虽在生成中纠正,但依赖昂贵的步骤级标注和奖励模型训练。本工作的 Chunk-Level Guided Generation 完全避免训练,直接利用现成大模型的似然作为过程打分器,且通过定长 chunk 设计解决了大模型打分不可靠的固有问题。与 PRM 搜索相比,CGS 不但省去了训练开销,还在同等推理预算下实现领先,证明了“off-the-shelf 大模型 + 定长 chunk + 对比选择”作为 inference-time scaling 的可行路径,尤其适合低资源场景或快速原型。
行业影响
落地场景
Chunk-Level Guided Generation 可直接嵌入需要多步推理且对错误敏感的智能系统:
- 数学与编程教育产品:AI 辅导 bot 用小模型生成解题步骤,大模型在每一步择优,提升正确率。
- 金融量化分析与研报生成:小模型撰写推理链,大模型过滤逻辑断点,减少事实错误。
- 医疗临床决策支持:按步骤生成诊断建议,过程打分防止中间推导偏离。
- 合同审查与法律分析:确保条款推理的每一步都符合先例。
商业价值
- 显著降本:无需训练专用的奖励模型(PRM),直接使用现成开源或 API 大模型打分,省去数百万 token 的标注与训练成本。小模型主打生成,总推理开销远低于全尺寸大模型。
- 准确度与体验双升:在 GSM8K、MATH 等基准上,CGS 超越多数投票可达 28pp,且推理链更短,终端用户获得更正确、更简洁的答案,降低弃用率。
- 灵活部署:可任意组合大小模型(如 Qwen2.5-1.5B + 32B),适配不同延迟或预算约束,拓宽盈利窗口。
与现有产品 / 工作流的接口
本方案是推理时优化,不改动模型权重,与现有 LLM 服务栈天然兼容:
- 可直接在 vLLM / TGI 等推理引擎上通过插件形式实现分块生成与打分循环。
- 大模型仅需输出
log-probability(无需自回归生成),可复用已有的 llm-as-a-judge 基础设施或内部 API。 - 与 LangChain 等框架结合,可快速构建过程监督 agent,为 RAG 或多步工具调用提供 error-robust 路径。
具体落地 Use Case
教育科技(数学辅导) 某全球在线数学平台采用 Llama-3.2-1B 作为交互模型,实时生成解题步骤;每一步用 Llama-3.1-70B 打分并选择最优 chunk。在同等延迟下,答案正确率从 56% 升至 83.9%,直接提升学习体验并降低人工审核成本。
金融量化分析 对冲基金使用小模型自动撰写股票分析报告。通过引入 Qwen2.5-72B 作为过程 scorer,剔除中间步骤的推理漏洞,避免了因为逻辑断裂导致的错误买卖信号,将分析报告的采纳率提高了 15%。
局限
- **依赖大模型的推理能力**:方法假设更大的语言模型(如32B/70B)能可靠地评分固定长度候选块,但在复杂推理任务中,大模型自身可能也缺乏足够的判断力,导致评分噪声,尤其当推理链中的关键步骤需要隐式知识或涉及多跳逻辑时。评分误差会在每一步选择中累积,可能使生成路径偏离正确解。
- **固定长度分块的局限性**:强制将生成过程切分为固定长度块(如10个token)可能破坏推理步骤的自然边界,影响评分准确性。论文指出可变长度步骤的似然评分因长度偏差而不稳定,但固定长度并非通用的解决方案,且最优块长度需针对不同任务和模型调整,增加了超参数调优开销。
- **计算开销与效率权衡**:每个步骤都需要从小模型采样k个候选块并由大模型计算对数概率,显著增加了推理延迟(k倍采样成本加上大模型前向传播)。尽管论文声称在匹配的引导预算下优于PRM,但实际部署中调用大模型的过程评分可能仍然昂贵,限制了低延迟应用场景。