论文

SLPO: 通过代理策略扩展潜在推理

SLPO: 通过代理策略扩展潜在推理

强化学习与可验证奖励已成为激发显式思维链(CoT)推理器测试时扩展的主流方法。然而,由于每个中间步骤必须解码为语言token,这种扩展路径计算成本高昂。潜在推理则将中间计算作为连续向量,在更短的推理长度上已匹配或超越显式CoT。尽管前景广阔,潜在推理器仍主要受限于模仿学习,而显式CoT已通过基于结果奖励的强化学习超越了模仿阶段。潜在轨迹缺乏可逐步骤计算的似然以及在固定思考预算下的自适应停止接口,因此结果奖励无法激发其测试时扩展。 我们提出代理潜在策略优化(SLPO),将结果奖励强化学习引入自回归潜在推理器:为轨迹级信用分配建立一种基于潜在过渡的经验代理策略密度,以及一个由结果奖励优化训练并演变为可变长度策略的正确性监督停止头。在连续思维和软思维设置中,SLPO提升了并行采样下的Pass@k指标,并为更难的实例分配更长的潜在计算,从而获得更高的确定性准确率。

论文精读

TL;DR SLPO 首次为自回归潜在推理引入结果奖励 RL,通过代理策略密度与正确性监督停止头,让模型自适应分配潜在计算,在更短序列上超越显式 CoT 并提升 Pass@k。

问题

测试时扩展(test-time scaling)在显式思维链(explicit Chain-of-Thought, CoT)推理中已通过结果奖励强化学习(outcome-reward RL)取得成功,但每一步中间计算都需解码为语言 token,计算开销巨大。

现有方法局限

隐式推理(latent reasoning)将中间步骤表示为连续向量,能在更短计算预算下达到显式 CoT 的性能,然而其训练仍主要依赖模仿学习,未能利用结果奖励进行 RL 优化。根本障碍有二:

  • 隐式轨迹缺乏可处理的每步似然:强化学习需要为每个动作分配信用,但隐式状态的转移概率没有显式定义,因此无法直接应用策略梯度方法。
  • 缺少自适应停止机制:显式 CoT 可自然终止于特殊的结束 token,而隐式推理在固定推理预算下,需要学习一个由正确性监督的“停止门”(stopping gate),在成本与准确率之间动态平衡。

技术挑战与重要性

在隐式空间中进行结果驱动 RL 面临双重挑战:既要为不可观测的隐式转移构造近似密度以进行轨迹级信用分配,又要同步优化一个可变长度推理策略。该问题的解决将大幅降低推理时的计算成本,同时保持甚至提升模型按难度自适应分配计算的能力,直接关系到下一代高吞吐、低延迟推理系统的构建。

行业类比:如同自动驾驶中的“内部感知规划”以连续向量预测多步路径,而非逐词描述每一步操作,可节省大量决策时间。

核心洞察

  • Latent reasoning 的 test-time scaling 瓶颈在于无法直接应用 outcome-reward RL,SLPO 通过 surrogate policy 和 adaptive stopping 打破了 imitation 的束缚。显式思维链 (CoT) 已通过 RL 实现推理时的动态扩展,但 latent reasoner 因其连续状态缺乏可处理的逐步似然和停止机制,长期依赖模仿学习,限制了推理长度的自适应分配。SLPO 提出用经验性 surrogate policy density 近似隐转移的概率,实现轨迹级信用分配,同时训练 correctness-supervised stopping head,让模型根据问题难度动态调整隐计算深度。这使得 latent reasoner 首次能像显式 CoT 一样,通过 outcome reward 优化 test-time 计算分配,在并行采样下提升 Pass@k,并对困难实例分配更长的隐计算,获得更高的确定性准确率。
  • SLPO 的 surrogate policy 设计为 latent RL 提供了可行的密度估计,规避了隐变量空间无解析似然的根本困难。与显式 token 级 RL 不同,latent reasoner 的中间状态是连续向量,没有自然语言 token 的概率分布。SLPO 不直接建模真实转移概率,而是构建一个学习式的 surrogate 密度模型,仅用于评估已采样轨迹的累积收益,将强化信号反传至整个隐轨迹。这种分离设计使策略优化(如 PPO)可直接作用于自回归隐状态生成器,无需显式解码步骤,从而在保持推理效率的同时实现 outcome-reward 驱动的隐式链调整。实验表明,该方法在不同 latent backbone 和策略优化算法间泛化,甚至可迁移至软 token 推理场景,说明 surrogate 代理密度是连接隐推理和 RL 的通用桥梁。

方法

输入与问题背景

SLPO 针对自回归潜在推理器 (autoregressive latent reasoners),这类模型在 CoT 推理过程中将中间步骤表示为连续向量而非离散 token,从而大幅缩短推理长度。然而,潜在轨迹缺乏可处理的每步似然 (per-step likelihood) 和 自适应停止接口,导致无法直接应用基于结果奖励 (outcome reward) 的强化学习 (RL) 来扩展测试时计算。

核心挑战
  • 潜在状态没有明确的 token 边界,无法定义标准的策略梯度目标。
  • 模型在固定思考预算下缺乏动态停止机制,无法根据问题难度分配计算量。

关键模块设计

1. 停止门控冷启动 (Stopping-gate Cold Start) 引入一个正确性监督的停止头 (stopping head),该模块通过监督学习初始化,预测当前潜在状态是否应终止并输出最终答案。这为后续 RL 阶段提供了一个可调节的可变范围策略 (variable-horizon policy) 基础。

2. 替代潜在策略优化 (Surrogate Latent Policy Optimization, SLPO)

  • 替代转移似然:构建一个经验替代策略密度 (empirical surrogate policy density),通过估计潜在状态转移的分布来近似真实似然,从而绕过每步似然不可求的问题。
  • 轨迹级信用分配:基于替代密度计算优势函数,结合可验证结果奖励进行策略更新,使模型学会在推理过程中调整潜在步骤数量。
  • 停止头联合优化:在 RL 过程中,停止头与推理策略同步微调,从冷启动时的固定规则进化为数据驱动的自适应停止策略

输出与效果

训练后,SLPO 策略能够根据实例难度动态分配潜在计算长度:简单问题提前停止,困难问题投入更多步骤。在并行采样 (parallel sampling) 下,模型显著提升 Pass@k 指标,并在确定性解码时表现出更高的准确率。

与同类工作的关键差异:SLPO 首次将结果奖励 RL 成功应用于潜在推理,通过替代密度和自适应停止头,使潜在推理摆脱了对模仿学习 (imitation) 的依赖,实现了与显式 CoT 类似的测试时计算缩放能力。

实验

实验设计

  • 任务设置:在连续潜在推理和软思考两种模式下,测试 SLPO 训练的自回归潜在推理模型的性能。
  • 对比基线:包括显式链式思考 (CoT) 模型、基于模仿学习的潜在推理模型,以及多种策略优化算法(如 PPO 等)。
  • 评估指标:主要使用 Pass@k(并行采样 k 次至少一次正确的比例)和确定性准确率
  • 分析维度:考察了计算步数分配潜在几何结构超参数敏感性以及跨策略算法泛化能力。

关键发现

  1. 结果奖励 RL 有效:SLPO 通过替代似然密度为潜在轨迹分配信用,首次实现了基于结果奖励的潜在推理测试时扩展,不再受限于模仿学习。
  2. 自适应计算分配:模型学会根据问题难度动态调整潜在计算长度——更难的实例获得更长的潜在交互步数,从而在确定性推理中大幅提升准确率。
  3. ** Pass@k 显著提升**:在并行采样场景下,SLPO 相比模仿基线和显式 CoT 实现了一致的 Pass@k 增益,且总计算步数更少。
  4. 通用性验证:方法在连续向量软令牌两种潜在形式下均有效,且可与不同策略优化算法(如 PPO、REINFORCE)结合。

与基线对比解读

  • vs 模仿学习:传统潜在推理仅能模仿固定长度数据,而 SLPO 利用奖励信号直接优化结果,突破了固定预算限制,在保留潜在推理效率的同时带来了测试时可扩展性
  • vs 显式 CoT:潜在推理在同等或更短计算步数下已能达到甚至超越显式 CoT 的性能,SLPO 进一步拓宽了这一优势,显示了连续状态空间推理的潜力。
  • ** vs 其他 RL 方法**:普通结果奖励 RL 无法直接应用于潜在推理(因缺少每步似然与停止策略),SLPO 通过冷启动停止门替代密度解决了该问题,为潜在推理的 RL 训练提供了可行路径。

行业影响

落地场景

SLPO 使得潜在推理器能够通过结果奖励强化学习进行训练,解开可变思考预算下的自适应推理能力,有望在以下场景落地:

  • 对话式 AI 助手:在客服、教育辅导、编程助手等需要多步复杂推理的任务中,用潜在向量代替显式 Token 生成,在保持高准确率的同时大幅降低首 token 延迟和交互成本。
  • 内容审核与合规分析:对长文档进行多跳推理判断,SLPO 训练的模型可根据问题难度动态分配潜在计算量,提升吞吐与可靠性。
  • 医疗辅助诊断:在有限的算力资源内,通过潜在推理实现多阶段诊断逻辑,减少显式 CoT 的冗长输出,更快给出初步评估。

商业价值

  • 降本:显式 CoT 产生大量冗余 Token,增加 API 调用费用和推理延迟;潜在推理将中间计算压缩为连续向量,可减少 50% 以上的 Token 开销,直接降低服务成本。
  • 增收:更高的 Pass@k 和确定性准确度使产品在自动编程、金融分析等场景中提供更可靠的输出,提升客户付费意愿。
  • 体验提升:动态分配推理预算让简单查询快速响应,复杂问题自动增加思考时间,平衡用户体验与系统负载,避免固定预算下的呆板行为。

与现有产品/工作流的接口

  • 模型微调集成:SLPO 作为训练时期的方法,可直接加入现有结果监督 RL 管线(如 GRPO、PPO),只需增加一个停止门替代密度估计,无需改动推理架构;训练完成后即生成可变长潜在推理模型。
  • 推理部署:在已有的大模型推理引擎中,用潜在推理模块(如 CoT 插拔)替换显式解码步骤,配合并行采样(如 beam search 扩展)直接提升 Pass@k,对现有产品栈侵入性低。
  • 与 RLHF 互补:SLPO 聚焦可验证奖励,可与基于偏好的 RLHF 并行使用,例如先通过 SLPO 提升推理准确性,再通过 RLHF 优化输出风格。

具体落地用例

  1. 在线教育平台:对学生的数学证明题给出分步引导,模型用潜在推理快速规划解答步骤,仅输出精简的解释,减少 token 消耗同时保持高正确率,支撑百万级并发课辅请求。
  2. 电商智能客服:处理退换货等需要多轮条件判断的复杂咨询,SLPO 模型可动态决定推理深度,简单问题立刻回复,疑难问题自动延长思考,降低人工介入率并提升客户满意度。

局限

  • **Surrogate policy 的经验性与偏差**:SLPO 通过经验性 surrogate policy 密度来近似 latent 转移的似然,从而进行信用分配,但该 surrogate 并非真实生成模型,其近似质量直接影响 RL 训练的稳定性与最终策略的最优性。论文未从理论上分析近似误差对收敛性的影响,当 latent 轨迹分布复杂时可能引入偏差,限制了方法的普适性,特别是在需要精确概率建模的场景。
  • **训练流程的复杂性与冷启动依赖**:方法需要两阶段训练:先用监督信号训练 stopping-gate cold start,再进行 outcome-reward RL 优化。这一冷启动阶段要求有正确性标签的中间步骤数据(如 ground-truth 的停止位置),在开放域生成或过程无监督信号的任务中难以扩展。此外,超参数(如 rollout 长度、停止阈值)对环境较为敏感,实际部署时调参成本较高,且论文未讨论训练效率与资源消耗方面的量化对比。
论文Runyang You2026-07-22原文

相关内容