论文

Cliff: 从第一次错误中学习过程奖励

Cliff: 从第一次错误中学习过程奖励

可验证奖励强化学习(RLVR) 已成为大语言模型(LLM)后训练的重要范式,但其对粗粒度结果奖励的依赖,导致对中间推理过程的指导有限。现有方法如过程奖励建模和在线策略蒸馏引入了额外限制,如依赖专门的奖励模型或假设师生具有相同的推理模式。 我们观察到,一旦推理过程首次出错,后续推理的评估信息有限,因为它已基于无效前缀。为此提出 Cliff,一种奖励塑形策略,利用现成 LLM 作为教师识别每次轨迹中的第一个错误。轨迹自然分解为正确前缀和不正确后缀。Cliff 将该信号转化为 token 级优势,为正确前缀分配正优势,其后分配负反馈。 在 12 个不同场景 中的实验表明,Cliff 持续提升推理性能,优于在线策略蒸馏 15%、标准 GRPO 7%,即使教师能力有限。此外,我们分析了“ground truth”在 Cliff 中的作用并研究其训练动态。这些结果确立了 Cliff 作为一种简单、通用且有效的方法,为 RLVR 提供更丰富的细粒度监督。

论文精读

TL;DR Cliff 用现成 LLM 定位推理中的首个错误,将 rollout 分解为正确前缀与错误后缀并分配 token 级优势,在 12 个场景中比 GRPO 提升 7%、比 on-policy distillation 提升 15%,无需专用 reward model。

问题

问题背景

当前强化学习与可验证奖励(RLVR)已成为 LLM 后训练的主流范式,通过在数学、代码等任务上利用自动验证器提供最终对错信号,显著提升了模型推理能力。

现有方法局限

  • 结果奖励稀疏:RLVR 通常只对整个 rollout 给予正向或负向的终局反馈,无法定位中间步骤的具体错误,导致学习信号粗糙。
  • 过程奖励模型(PRM) 需要额外训练一个专门的奖励模型来评估每个步骤,成本高,且对训练分布漂移敏感,难以在在线 RL 中直接复用。
  • on-policy distillation 依赖教师模型与学生的推理模式同构假设,即学生应模仿教师的推理路径;但现实中学生可能采取不同但同样正确的步骤,强制对齐会引入错误惩罚或无效引导。
  • 关键观察:一旦推理过程首次出错,后续步骤基于错误前缀,继续评估它们提供的信息有限。然而现有方法仍对整个 rollout 均匀赋分,浪费信号并可能误导模型。

为什么这个问题难/重要

获取细粒度过程监督本质上需要标注中间推理状态,既要判断正确性,又要避免引入额外约束或昂贵的专用模型。业界对推理能力的提升需求持续高涨,但训练效率和细粒度信号之间的平衡仍是核心挑战。低成本、即插即用、不依赖强假设的过程奖励方法成为刚需。

行业类比

类似代码 CI 流水线中,编译器报告第一个失败测试后,后续因依赖关系而引发的连续失败信息往往冗余;聚焦“首个失败点”能更高效地定位和修复问题,这与本文方法的核心思想一致。

核心洞察

  • Cliff 的核心是识别每个 rollout 中的第一个错误步骤,将推理过程分解为正确前缀和错误后缀,并转化为 token-level advantages。相比 process reward modeling 需要训练专门的奖励模型,Cliff 直接使用现成 LLM 作为 teacher 来定位第一个错误,极大降低了实施复杂度;相比 on-policy distillation 假设师生推理模式一致,Cliff 不要求 teacher 和 student 具有相同的推理路径,因此更通用。利用错误的不可逆性——第一个错误之后的步骤都基于无效前缀,反馈价值有限——Cliff 将监督集中在关键分界点,避免了冗余的过程评价。
  • Cliff 将错误定位转化为一种阶梯式优势:正确前缀分配正优势,错误后缀分配负优势,形成悬崖形状的奖励塑形,比标准 GRPO 的粗粒度 outcome reward 提供更细粒度的学习信号。实验显示,即使 teacher 模型能力一般,Cliff 仍能稳定提升推理性能(比 on-policy distillation 高 15%,比 GRPO 高 7%),说明该方法对 teacher 质量不敏感,工程部署门槛低。这种将错误检测与优势赋值解耦的设计,无需在线训练专门奖励模型,也避免了对每个步骤都打分的高成本,因此适合大规模 RLVR pipeline。

方法

输入与分解

对每个 prompt 采样一组 rollout,每个 rollout 由多步推理的 token 序列构成。使用现成的 teacher LLM 逐个 rollout 识别 第一个错误步骤(pitfall step),将该步骤之前的 token 标记为 正确前缀,之后的 token 标记为 错误后缀。

关键模块:token-level advantage 塑造

  • 先由 outcome verifier 给出粗粒度正确性标签。
  • 若 rollout 错误:根据 pitfall step 切分,前缀 token 获得正 advantage,后缀 token 获得负 advantage。
  • 若 rollout 正确:所有 token 均获得正 advantage。
  • 引入超参数 λ 平衡正负优势强度(论文对 λ 的选择做了分析),并通过 ground truth filter 过滤 teacher 判断不可靠的样本。

输出与优化

将上述 token-level advantages 替代 GRPO 中稀疏的 outcome reward,用于策略梯度更新。GRPO 的 group relative 形式保留,但 advantage 项由 Cliff 提供,使模型获得步骤级别的细粒度反馈。

与 on-policy distillation 不同,Cliff 不要求 teacher 和学生共享推理路径,也不训练独立 reward model,仅利用 teacher 的 pitfall 定位能力即可实现过程级监督。

实验

实验设计

论文在 12 个推理场景 上评估 Cliff,对比基线包括 GRPO 和 on-policy distillation。Cliff 使用现成 LLM 作为 teacher 识别每个 rollout 的首次错误,将其分解为正确前缀与错误后缀,并转换为 token 级 advantage:正确前缀赋予正 advantage,后缀赋予负反馈。实验还包括 teacher 判断质量评估、参考解质量影响、无 ground truth filter 消融、λ 选择、训练动态与长度动态分析。

关键发现

在 12 个场景中,Cliff 一致提升推理性能:

  • 相对 on-policy distillation 平均提升 15%
  • 相对标准 GRPO 平均提升 7% 即使 teacher 能力一般,改进依然显著。分析表明 ground truth 在 Cliff 中发挥重要作用,过滤错误 solution 可进一步提升训练稳定性。训练动态显示 Cliff 有效缓解了长度偏差与奖励黑客问题。

与基线的深度对比

Cliff 不需要额外的过程奖励模型,仅用现成 LLM 作为 teacher,避免了 process reward modeling 的训练开销。与 on-policy distillation 假设教师和学生推理模式一致的强约束不同,Cliff 只依赖识别首次错误,对 teacher 能力要求较低且泛化性更好。Token 级 advantage 提供了比 outcome reward 更细粒度的过程监督,这解释了其在多个基准上稳定优于 GRPO 的原因。

行业影响

落地场景

Cliff 适合所有采用 RLVR 做 LLM 后训练、且推理过程可验证的业务,包括:

  • 代码生成助手:训练模型在写代码途中识别首个逻辑错误,减少后续无效分支
  • 数学 / 科学解题产品:逐步推理中一旦出错立即给予 token 级负反馈,提升最终答案准确率
  • 金融 / 医疗决策支持:对推理链路要求高的场景,利用现有 LLM 教师标注首个错误步骤,细化监督信号
  • 客户服务自动化:多步流程推理(如订单处理、故障诊断)中更早纠正偏差,降低错误响应率

商业价值

-Cliff 用 off-the-shelf LLM 教师替代专门训练的 reward model,免去训练和部署额外 reward model 的成本。

  • 相比标准 GRPO 提升 7%、相比 on-policy distillation 提升 15%,推理质量改善可直接转化为产品价值:降低客服出错率、减少代码生成 bug 修复成本、提升教育产品用户留存。
  • token 级优势基于“首个错误”分解 rollout,训练信号更稠密,有望减少达到相同性能所需的采样量,从而节省推理与训练算力。
  • 该方法对教师模型能力要求低(modest capability 即可),中小企业也能用公开权重模型实现高质量过程监督。

与现有产品 / 工作流的接口

Cliff 是 reward shaping 策略,可无缝嵌入现有 RLVR 训练管道,改动集中在优势计算阶段:

  1. 在 rollout 生成后,调用一个现成的 LLM 作为教师,对每个轨迹执行 pitfall step identification
  2. 将轨迹分成 correct prefix 和 incorrect suffix,据此计算 token-level advantages
  3. 替换原来的 outcome reward advantage,传入策略优化器(如 GRPO)
  4. 无需改变模型架构、数据格式或推理部署,只需增加一次教师 LLM 调用,可通过批处理或缓存进一步降低额外延迟

具体 use case:

  • 在线编程教育平台:用 Cliff 训练模型提供分步解题指导,一旦学生/模型的解题思路第一步出错,立即反馈纠正,而非等最终答案错误。
  • 企业级数据分析助手:生成 SQL 或分析流程时,利用 Cliff 提升多步推理正确率,减少因中间步骤错误导致的查询失败,直接提升用户信任和续费率。

局限

  • - **依赖教师 LLM 的判定质量**:Cliff 使用现成 LLM 识别首次错误,但教师模型并非完美。论文案例研究显示,教师判定的陷阱步可能与人类专家不一致(附录 E.3)。当任务领域复杂或超出教师能力时,错误识别可能不可靠,进而误导优势分配。此外,教师推理会引入额外计算开销,且不同教师的表现差异需要进一步研究。
  • - **对 ground truth 的依赖可能限制应用场景**:论文分析了无 ground truth 过滤时 Cliff 的表现,发现性能下降。因为 Cliff 的优势分配依赖于正确前缀,若没有 ground truth 验证,可能无法准确界定正确前缀边界。在实际 RLVR 任务中,可验证奖励是常见的,但某些开放式任务或弱监督场景下,ground truth 可能缺失,此时 Cliff 的有效性会受影响。
  • - **与完整过程奖励建模相比,信息粒度较粗**:Cliff 只识别第一个错误,将后续所有 token 标记为负优势,忽略了错误后的推理中可能仍然正确的部分。这种粗粒度反馈可能限制了模型对复杂错误模式的捕获能力,尤其是当推理链包含多个独立错误或后续有部分正确推理时。相比之下,逐步骤过程奖励模型能提供更细粒度的信号。
论文Peixuan Han2026-09-02原文

相关内容