论文

REVES: REvision and VErification--Augmented Training for Test-Time Scaling

REVES: REvision and VErification--Augmented Training for Test-Time Scaling

Test-time scaling 通过序列修订已成为增强大语言模型(LLM)推理能力的强大范式。然而,标准的后训练方法主要优化单次目标,与多步推理动态存在根本性错配。虽然近期工作将其视为多轮强化学习(RL),但传统方法直接优化多步轨迹,未能进一步利用中间步骤中模型可通过修正学习的高质量错误。 我们提出一种两阶段迭代框架,交替进行 在线数据/提示增强 与 策略优化。通过将成功恢复轨迹中的中间步骤(“接近命中”答案)转换为独立的修订与验证提示,该方法聚焦于有效的答案转换与错误识别。相比标准多轮 RL,该方案实现了高效的离策略数据生成,并减少了长时域采样的计算开销。 在 LiveCodeBench 上,使用公开测试用例作为反馈,我们观察到相比 RL 基线提升 +6.5 分,相比标准多轮训练提升 +4.0 分。除编程外,在圆形填充问题上,我们以最小基础模型(4B)匹配此前报告的 SOTA 结果,且推演次数远少于更大规模的进化搜索系统。在基于真实验证的数学结果进一步证实了修正能力的提升。该方法还能泛化到分布外约束满足谜题(如 nqueens 和 minisudoku),其中正确性完全由问题约束定义。代码见 https://github.com/yxliu02/REVES.git。

论文精读

TL;DR REVES 通过将推理过程的“近失”错误解耦为修正与验证任务,迭代增强数据与策略优化,有效训练模型在测试时自我纠正,大幅提升多步推理基准成绩。

问题

问题背景

大语言模型(LLM)的推理能力在复杂任务中日益依赖测试时扩展(Test-Time Scaling),即通过多步顺序修订(sequential revision)迭代改进答案,例如在编程、数学推理中利用执行反馈进行自我修正。这类范式显著提升了模型表现,但后训练方法的设计仍存在根本性错位。

现有方法局限

  • 目标不一致:主流后训练(如SFT、单轮RLHF/DPO)优化单步生成目标(pass@1),而测试时实际执行多步推理,导致策略在长链修正中性能退化。
  • 数据利用低效:近期工作将多步修订视为多轮强化学习(multi-turn RL),直接优化完整轨迹。但这种方法仅给予整个轨迹一个奖励,忽略了中间步骤的高质量“近似错误”(near-miss)——模型在修正过程中产生的部分正确、部分错误的答案,如果能被单独提取并用于训练,可强化错误识别与答案转化能力,现有方法未能利用这一信号。
  • 计算开销大:传统多轮RL需要在线采样长轨迹,效率较低,且往往将修订行为与验证行为耦合,难以针对性提升各自能力。

问题难度与重要性

将测试时扩展建模为**元强化学习(Meta-RL)**问题,其训练目标不同于最大化单次回答正确率,而是最大化经过多步修正后的最终正确率。这要求模型不仅生成初始答案,还要学会识别错误并有效修订。技术挑战包括:如何高效生成多样化的修正路径数据,如何设计奖励机制解耦修订与验证子能力,以及如何在有限的计算预算下进行策略优化。随着LLM被广泛用于代码生成、数学证明、约束满足等需要外部验证的场景,准确的多步自修正能力已成为该领域的核心需求。

行业类比

类似自动驾驶中的轨迹重规划——系统不仅需要初始路径,还必须实时检测偏差并快速修正,这与LLM推理中检测自身错误并迭代修订答案的过程高度一致,凸显解耦感知与决策的价值。

核心洞察

  • **利用“近似正确”中间步骤的纠错信号训练可自我修正的推理策略。** 与标准多轮RL直接优化完整轨迹不同,REVES从成功恢复的轨迹中提取中间步骤(near‑miss answers),将其转化为解耦的修订提示和验证提示,迫使模型学习“如何修正错误”和“如何识别错误”。这种以“恢复路径”为导向的训练信号,比单纯奖励最终正确答案更精细地塑造了模型的增量推理能力,从而在代码和数学基准上显著超越多轮RL基线(+4.0~+6.5分)。
  • **迭代式数据增强与策略优化交替进行,实现离策学习下的高效测试时扩展。** 传统的多轮RL每轮训练都需重新采样长轨迹,计算开销随轮次线性增长。REVES将数据生成与策略更新交替执行,在固定策略下通过提示增强批量合成高质量离策样本,再集中进行策略优化,大幅降低对长轨迹采样的依赖。这种“生成‑优化”循环不仅提升了样本效率,还使4B小模型在圆包装任务上匹配大得多的进化搜索系统的最佳结果,验证了方法的可推广性。

方法

问题建模:测试时扩展作为元强化学习

REVES 将测试时顺序修订能力建模为一个元 RL 问题,训练目标记为 $J_{\phi_{\text{SR}}}$,直接优化单次生成 pass@1 并不等同于优化该目标。该方法专注于恢复级监督(recovery-level supervision),即从成功修正的轨迹中提取中间步骤的“近失”答案,学习如何从错误中恢复,而非简单地对整个多步轨迹给予信度分配。

核心方法:两阶段迭代框架

输入:一个预训练的 LLM 策略 $\pi_\theta$,以及带真实检验信号的推理任务(如代码测试用例、数学答案验证)。

关键模块——阶段 1:在线数据与提示增强

  • 使用当前策略在任务上采样,收集成功的恢复轨迹(初始输出错误但经过修订后正确的序列)。
  • 从每个恢复轨迹中提取“近失”中间步骤,将其转化为一对解耦的提示:
    • 修订提示(revision prompt):包含错误答案和原始问题,要求模型修正错误并生成正确结果。
    • 验证提示(verification prompt):包含错误答案和原始问题,要求模型定位并解释错误位置。
  • 这些提示对将训练信号集中在答案转换(修正能力)与错误识别(定位能力)两个维度上。

关键模块——阶段 2:策略优化

  • 使用阶段 1 生成的分离提示作为训练数据,采用 off-policy RL(如 PPO)对策略进行微调。
  • 损失函数同时鼓励模型在修订提示下生成正确最终答案,并在验证提示下准确指出错误片段。
  • 这个过程迭代进行:新策略再次采样,产生新的恢复轨迹,进一步扩充训练数据,形成持续的数据增强循环

输出:一个具备更强顺序修订自我纠错能力的策略,测试时可通过多轮修订显著提升推理性能。

效率与停止规则

REVES 通过分离提示和 off-policy 训练,避免了标准多轮 RL 中必须对完整长轨迹采样带来的高计算开销。测试时引入置信度阈值作为停止规则:当模型对当前答案的置信度超过预设阈值时停止修订,平衡性能与推理成本。

与同类方法的差异

STaRRISE 等直接优化多轮轨迹或仅利用最终正确答案的方法不同,REVES 从中间错误中构造训练信号,将“失误”转化为针对性学习任务,使得模型更高效地获得修正能力,且在与标准多轮 RL 相同甚至更少的采样下实现显著提升。

实验

实验设计

REVES 采用两阶段迭代流程:数据/提示增强策略优化 交替进行。核心创新在于将成功恢复轨迹中的中间步骤(“near-miss” 回答)转化为解耦的 修订提示验证提示,使训练聚焦于答案变换与错误识别。编码任务使用 LiveCodeBench,以公开测试用例作为反馈;数学推理采用 ground-truth 验证;泛化实验引入 n_queensmini_sudoku 等约束满足谜题,测试分布外性能。基线包括标准 multi-turn RL 和直接多步训练。

关键发现

  • LiveCodeBench 上,REVES 相较 RL 基线提升 +6.5 分,较多轮训练基线提升 +4.0 分
  • circle packing 任务上,仅使用最小的 4B 基座模型和更少的 rollout,即匹配此前报道的 SOTA 结果。
  • 数学推理中,ground-truth 验证下的纠正能力显著增强。
  • n_queensmini_sudoku 上表现出良好的 OOD 泛化。
  • 消融实验确认 修订/验证提示 的必要性,以及 持续数据增强 和充足 增强预算 的作用。

与基线的深度对比

传统 post-training 方法优化 单次 pass@1,与测试时的多步修订动态存在本质偏差。Multi-turn RL 直接优化多步轨迹,却浪费了中间步骤的高质量错误——这些错误正是模型学会自我纠正的宝贵信号。REVES 通过分解修订与验证子目标,将 路径级信用 转化为 恢复级监督,使训练信号更精细地集中在错误定位与修正上。这一设计不仅提升了性能,还通过 off-policy 数据生成 显著降低了长跨度采样的计算开销,让有限规模模型也能高效提升序列修正能力,对实际工程落地具有重要参考价值。

行业影响

落地场景

REVES 框架主要赋能需要 多步推理与自我修正 的 AI 产品,包括:

  • 代码生成与调试助手(如 GitHub Copilot、Codeium):利用公共测试用例反馈,在推理时通过序列修正将“近似正确”的代码逐步优化至完全通过所有用例。
  • 数学 / 科学解题引擎(如在线教育平台、题库软件):在给出最终答案前,模型能自动识别并修正中间步骤的错误,提升解答的可信度与可解释性。
  • 约束满足问题求解(如排程、布局优化):在芯片布局(如 circle packing)、调度、拼图(如 n-queens、sudoku)等场景中,模型通过自我校验不断逼近合法解。

商业价值

  • 降本:削弱对昂贵人工审查的依赖。代码助手能减少人工 debug 时间;数学辅导产品可自动检出步骤错误,降低教师介入成本。
  • 增收:更精准的解答提升用户付费意愿及续费率。在代码竞赛或教育测评场景中,高首次通过率直接转化为产品竞争力。
  • 体验提升:用户获得 带修正过程的最终答案,而非单次不完美输出,透明度与信任感增强。同时,模型能兼顾 pass@k 与 pass@1 的提升,使单次响应的可用性大幅跃升。

与现有产品 / 工作流的接口

REVES 作为一个训练框架,可无缝接入现有 LLM 训练流水线:

  1. 训练阶段:利用现有 RLHF/DPO 基础设施,将单轮数据转换为“修正-验证”双提示格式,交替进行数据增强与策略优化。该过程可借助现有开源库(如 TRL、DeepSpeed Chat)实施。
  2. 推理阶段:部署时启用 测试时缩放(test-time scaling),模型在生成初稿后,执行若干轮自我修正。可在推理服务中添加置信度阈值或最大轮次控制延迟,平衡吞吐与准确率。
  3. 集成示例
    • 代码助手:模型在后台执行多次“生成→运行测试→修正”循环,最终只向用户展示通过测试的版本。
    • 在线数学辅导:学生提交答案后,模型先尝试解答;若答案错误,自动生成一个带修正步骤的解析,帮助学生理解错误根源,而非简单给答案。

局限

  • 依赖特定反馈信号:REVES 在代码任务中使用公开测试用例作为二元反馈,在数学推理中使用 ground-truth 验证。对于许多现实任务,此类精确反馈难以获取,限制了方法的通用性。论文的圆包装实验虽用程序化奖励,但可能不适用于开放式生成。
  • 方法效果依赖成功恢复轨迹:REVES 从“几乎正确”的中间步骤构建训练数据,这要求基础模型本身具有一定的自我修正能力,能产生成功的恢复路径。对于极弱模型或极难任务,可能无法生成足够的高质量恢复轨迹,导致数据增强失效。
  • 计算开销和可扩展性:尽管 REVES 声称比标准多轮 RL 更高效,但仍需在线策略改进和迭代数据增强,这可能带来较大的采样和训练成本,尤其在长 horizon 任务中。论文未详细分析在更大规模模型(如 70B+)上的扩展性,以及不同任务领域下的效率对比。
论文Yuanxin Liu2026-06-17原文

相关内容