Unsupervised Process Reward Models
过程奖励模型 (Process Reward Models, PRMs) 是一种强大的机制,通过提供细粒度的步骤级监督来引导大语言模型推理。然而,这种有效性伴随着高昂成本:PRM 需要为每个推理步骤提供专家标注,导致其代价高昂且难以扩展。 本文提出一种训练无监督 PRM (uPRM) 的方法,无需人工监督——既不需要步骤级标注,也不需要最终答案的真实验证。其核心思想是定义一个从 LLM 下一词元概率推导出的评分函数,该函数联合评估一批推理轨迹中首个错误步骤的候选位置。 我们在多种场景下验证了 uPRM 的有效性:(i) 在 ProcessBench 数据集上识别首个错误步骤时,uPRM 相比 LLM-as-a-Judge 实现了高达 15% 的绝对准确率提升;(ii) 作为测试时扩展的验证器,uPRM 性能与有监督 PRM 相当,并比多数投票基线高出最多 6.9%;(iii) 在强化学习中用作奖励信号时,uPRM 相比使用真实标签训练的有监督 PRM 在训练过程中实现了更稳健的策略优化。 总体而言,我们的结果为复杂推理任务的可扩展奖励建模开辟了新路径。
论文精读
TL;DR 无需人工标注,利用 LLM 下一 token 概率联合评估推理步骤错误位置,训练无监督过程奖励模型(uPRM),在识别错误步骤、测试时扩展和强化学习中均表现优异。
问题
问题背景
在数学、编程等复杂推理任务中,大语言模型 (LLM) 的逐步推理能力已成为性能核心,而过程奖励模型 (Process Reward Models, PRM) 作为一种对推理中间步骤提供细粒度反馈的机制,显著提升了模型推理的可靠性与可控性。
现有方法局限
当前主流的 PRM 依赖人工标注,主要存在两种监督范式:
- 逐步标注:需要专家对每个推理步骤标注正确性,获取成本极高,且难以覆盖多样化的推理路径。
- 最终答案验证:仅通过最终结果正确与否来训练奖励模型,虽然降低了标注复杂度,但缺乏中间步骤的定位能力,导致奖励信号稀疏,无法有效指导模型修正错误步骤。 这些限制使得 PRM 难以在需要快速迭代、覆盖广泛推理任务的实际场景中规模化应用。
技术挑战与行业关注度
该问题的核心难点在于:如何在没有任何人类监督(即不依赖逐步标签,也不使用最终答案真值)的条件下,自动且可靠地识别推理轨迹中的首个错误步骤。这要求模型能够从大规模未标注推理数据中自主学习到步骤级的正确性评估能力。在工业界,随着 LLM 被用于自主代码生成、定理证明、科学问题求解等高风险场景,对可扩展、低成本的推理过程校验机制需求迫切,无监督 PRM 被视为解锁这一瓶颈的关键。
行业类比
这类似于自动驾驶中从依赖高精地图的监督学习转向纯视觉无监督环境感知:摆脱昂贵的手工标注,让模型从原始数据中自发理解中间状态的合理性,从而大幅降低部署与扩展的门槛。
核心洞察
- 利用 LLM 自身的 next-token 概率作为隐式监督信号,完全去除了对人工步骤标签或最终答案正确性的依赖,实现了无监督的过程奖励建模。与有监督 PRM 需要昂贵专家标注、或仅依赖答案级反馈的方法相比,uPRM 仅通过模型预测概率构建联合评分函数,在识别错误步骤、测试时扩展和强化学习训练中均达到甚至超越有监督基线,大幅降低了规模化部署的成本壁垒。
- 通过对一批推理轨迹的联合评估来定位首个错误步骤,而非孤立地分析单条轨迹。与常见的逐步骤分类或 LLM-as-a-Judge 方法相比,uPRM 的批处理联合评分机制有效利用了轨迹间的相互一致性信号,在 ProcessBench 上将错误检测准确率绝对提升 15%,并在后续的多数投票扩展和 RL 训练中展现出更强的鲁棒性,避免了对单条轨迹过拟合的风险。
方法
输入:无标注的推理轨迹批次
uPRM 的训练数据仅需由策略模型(如待优化的 LLM)生成的多条完整推理轨迹,每条轨迹包含若干自然分割的步骤(例如思维链片段)。无需任何人工步骤级标注或最终答案真值验证。
核心模块:基于 LLM 下一个 token 概率的联合评分
uPRM 的核心创新是一种无监督评分函数,它从 LLM 自身的下一个 token 预测概率中衍生,用于衡量轨迹中每个步骤成为“第一个错误步骤”的可能性。具体机制如下:
- 单步骤评分:对于轨迹中的某个步骤,利用基础 LLM 计算在该步骤之前的所有上下文条件下,该步骤文本的对数概率(或困惑度)。直觉上,错误的步骤会偏离模型的高概率区域,导致较低的概率分数。
- 跨轨迹联合校准:单条轨迹的绝对概率易受表面流畅性影响,因此 uPRM 在一个 batch 内联合评估多个候选错误位置。它构建一个对比任务:对于每一条轨迹,将其正确链路(假设前面的步骤均正确)与引入潜在错误的位置进行配对,通过比较不同轨迹和不同位置的相对得分,学习一个能够区分正确与错误步骤的排序函数。
- 训练目标:通过优化该联合评分函数的期望,使得正确步骤(或其之前位置)的得分显著高于错误步骤的得分。训练过程中使用熵正则化等手段避免退化解(如所有步骤得分为零)。
输出与应用
训练得到的 uPRM 可作为步骤级质量评估器,直接应用于三种场景:
- 错误步骤检测:在给定推理轨迹中,输出第一个错误步骤的位置预测。
- 测试时验证:在多数投票或 best-of-N 采样中,根据步骤得分加权选择最优答案,替代监督 PRM。
- 强化学习奖励信号:为策略模型提供细粒度的中间奖励,引导其学习正确的推理路径。
与同类方法的差异
不同于需要昂贵人工标注的监督式 PRM,也不同于仅依赖最终答案对错的 LLM-as-a-Judge 或 结果奖励模型(ORM),uPRM 完全利用语言模型内在的概率知识,通过跨轨迹的自监督对比学习捕获步骤级正确性,从而在复杂推理任务上实现可扩展的奖励建模。
实验
实验设计
uPRM 在三个维度评估:在 ProcessBench 数据集上检测推理轨迹的第一步错误,对比 LLM-as-a-Judge 基线;作为测试时缩放验证器,与监督 PRM 和多数投票比较;在强化学习训练中作为奖励信号,与基于真值标签的监督 PRM 对比。所有实验使用 LLM 的 next-token 概率构建联合评分函数,在批量的推理轨迹上估计错误位置。
关键发现
- 错误检测:uPRM 在 ProcessBench 上实现绝对准确率提升最高达15个百分点(对比 LLM-as-a-Judge),表明无需人工标注即可有效捕获步骤级错误模式。
- 测试时缩放:作为验证器,uPRM 性能与监督 PRM 相当,且比多数投票基线提升最高6.9%,证明了无监督奖励模型在引导推理时的竞争力。
- 强化学习:uPRM 提供的奖励信号在训练全过程中策略优化更稳健,比使用最终答案真值的监督 PRM 表现出更低的奖励欺骗倾向和更好的泛化。
基线对比解读
uPRM 的核心优势在于全无监督特性,避免了昂贵的人工步骤标注。相较于 LLM-as-a-Judge(单轨迹评分),uPRM 通过跨轨迹联合评估候选错误位置,利用了批次内的一致性信息,从而更准确。与监督 PRM 对比,uPRM 在不牺牲太多性能的前提下大幅降低标注成本;在测试时缩放中甚至可与监督方法性能持平,这对规模化部署极具吸引力。与多数投票相比,uPRM 不是简单统计答案频率,而是基于过程质量进行加权,因此在复杂推理任务上能取得显著更高的准确率。
行业影响
落地场景
无监督过程奖励模型 (uPRM) 可直接嵌入任何需要细粒度推理验证的 AI 产品中,典型场景包括:
- 数学/代码辅导助手:自动定位学生解题或编程过程中的第一个错误步骤,提供精准反馈,无需人工标注步骤标签。
- 企业级决策辅助:在金融分析、医疗诊断等高风险领域,对 LLM 生成的推理链进行逐步骤可信度评估,筛选出可靠推理路径,降低最终输出错误率。
- AI Agent 工具链:作为 Reward Model 参与强化学习训练,或作为测试时验证器(Verifier)指导搜索/投票,提升复杂任务完成率。
商业价值
- 降本:消除过程监督数据的人工标注成本(通常需领域专家逐步骤标注),使 PRM 训练可规模化覆盖任意推理领域。
- 体验提升:在辅导或 Code Review 产品中,精确到步骤的错误定位能大幅提高用户学习效率和问题解决成功率;在决策系统中,过程监督减少“正确答案但错误推理”的隐患,增强可信度。
- 增收:更强的推理验证能力可直接转化为产品差异化竞争力,例如金融分析工具可通过高准确率推理校验吸引专业用户付费。
与现有产品/工作流的接口
- 推理阶段集成:作为验证器挂接到现有
Best-of-N或树搜索推理框架中,对候选推理轨迹进行步骤级评分,取代粗粒度的结果奖励模型或多数投票。 - 训练阶段集成:在 RLHF/GRPO 等流程中替换或补充结果监督奖励模型,提供稠密的步骤级奖励信号,提升策略优化稳定性。
- 轻量集成:uPRM 仅需 LLM 的 next-token 概率,可封装为独立微服务,通过 API 接入 HuggingFace TGI、vLLM 等推理引擎,无需改动现有训练管线。
具体落地用例
- 在线编程教学平台:用户提交代码时,系统不仅给出最终测试结果,还使用 uPRM 分析用户生成的思考笔记或注释推理链,标记第一个逻辑错误步骤,辅助教师规模化提供个性化指导。
- 客户服务问答系统:在复杂多步解答场景(如保险理赔流程咨询),uPRM 作为内部审核器评估客服 LLM 的推理步骤是否合规,自动拦截不合规推理并转人工,降低合规风险。
以上场景均无需地域化前置条件,可全球部署。
局限
- **对基础 LLM 质量高度依赖**:uPRM 的评分函数完全基于 LLM 的 next-token 概率,因此其识别错误步骤的能力受限于底层模型的推理与校准水平。若基础模型在特定领域(如数学或代码)表现不佳,或概率分布存在系统性偏差,错误步骤定位将不可靠。论文未详细讨论如何选择或适配不同能力的 LLM 作为评分 backbone,也未分析模型校准误差对下游任务(如 RL 训练)的累积影响。
- **计算开销与批处理规模的平衡**:通过联合评估一批轨迹来定位首个错误步骤,要求在同一批内比较多条完整推理路径。当轨迹很长或 batch 很大时,内存和推理延迟会显著增加,限制了该方法在资源受限环境或实时系统中的部署。论文未给出 batch size 对性能影响的详细消融实验,也未探讨如何高效近似联合评分以降低实际工程成本。
- **评估范围有限且对比基线较弱**:虽然 uPRM 在 ProcessBench 上比 LLM-as-a-Judge 提升 15%,但该基准主要覆盖数学和部分逻辑推理,缺乏多样化开放域任务测试。与监督 PRM 的比较仅声明“可比”,未在多个基准上与 Math-Shepherd、Step-DPO 等强监督方法全面对标;在 RL 实验中,也缺少与基于 ground-truth 的 PRM 在更复杂环境下的长期训练稳定性对比。