论文

揭示隐状态循环:基于在线策略强化学习的可切换潜在推理

揭示隐状态循环:基于在线策略强化学习的可切换潜在推理

潜在思维链(latent chain-of-thought)通过用连续的隐状态循环替代可见推理迹来压缩推理,但现有形式难以用标准在线策略强化学习(on-policy RL)优化,且缺乏因果可解释性。我们的核心洞察是:一对显式的边界令牌可同时解决这两个问题:离散的进入和退出锚点使潜在模块与标准在线策略 RL 兼容,同时为机制分析提供了自然支点。 为此,我们提出 SWITCH——一种可切换潜在推理框架。模型发射 <swi 进入潜在模式,</swi 退出。由于边界是普通离散令牌,GRPO 策略比率(policy ratio)在每个决策点定义良好。这些锚点还使潜在步骤可直接进行探测和因果干预。我们通过可见到潜在课程(visible-to-latent curriculum)和 Switch-GRPO 目标(该目标通过循环潜在计算传播梯度)来训练模型。 实验表明,SWITCH 在相似规模下持续优于先前的隐状态循环潜在推理方法。通过边界令牌的机制分析揭示了三个发现: 1. <swi 是一种精确定位的习得切换策略,而非风格化伪影; 2. 它开启的潜在步骤执行问题特定的因果重要计算,而非惰性占位符; 3. 该计算集中在进入时的单次隐状态转换上。 这些结果共同表明:隐状态循环潜在推理既可通过 RL 训练,也开放给直接的机制分析,包括在线策略 RL 如何从内部改进模型。

论文精读

TL;DR SWITCH 框架通过一对显式边界 token(<swi> 与 </swi>)让隐状态循环潜在推理既能用标准 on-policy RL 训练,又能进行因果机制分析,解决了此前方法难以优化和解释的痛点。

问题

问题背景

在计算资源受限或追求推理效率的场景下,隐式思维链(latent chain-of-thought) 试图用连续的隐藏状态递归代替显式的文本推理轨迹,从而压缩推理过程的 token 开销。这类方法在数学、代码等复杂推理任务上已展现出潜力,成为高效推理的研究热点。

现有方法局限

现有隐式推理范式(如 Coconut、CODI)主要面临两大工程瓶颈:

  • 难以用标准在线策略强化学习(on-policy RL)优化:由于缺少离散的动作边界,传统的策略梯度方法(如 GRPO)无法直接定义 sequence-level 的策略比率,导致无法稳定地将奖励信号传播到隐状态内部。
  • 可解释性差:连续的隐藏状态递归构成“黑盒”,难以进行因果干预和机制分析,使得模型内部推理行为不可审计,也不利于调试和知识发现。

为什么这个问题难且重要

  • 技术挑战:既要保持隐式推理的压缩优势,又要兼容 RL 训练和可解释性要求,本质上需要在连续表示中嵌入离散的“锚点”,同时保证梯度流动顺畅。
  • 业界关注度:随着大模型推理成本急剧上升,压缩推理过程而不损失性能成为落地关键。RL 训练(尤其是 GRPO)正在成为提升推理能力的主流范式,让隐式推理也能从 RL 中获益,是打通“高效推理 + 自我改进”闭环的必经之路。

行业类比

该问题类似于自动驾驶中的端到端模型:直接输出控制信号效率高但难以调试,而引入离散的中间表示(如道路标记)既能保持效率,又能提供可审计的决策锚点。

核心洞察

  • 引入显式开关标记 <swi> 和 </swi> 将隐藏状态循环计算封装为标准 on-policy RL 可优化的离散动作块,解决了此前方法(如 Coconut)无法直接使用 GRPO 等算法优化循环潜在推理的难题。由于边界标记是普通离散 token,策略比在每一决策点都有明确定义,使得梯度可通过循环潜在计算传播,从而让模型能够端到端地学习何时进入潜在模式以及如何利用内部状态进行推理。
  • 同一对边界标记天然成为机制分析的锚点,使得原本被压缩在隐藏状态中的推理过程首次可被直接探测和因果干预。实验显示 <swi> 并非风格假象,而是一种尖锐局部化的学习切换策略;潜在步骤执行与问题相关的因果重要计算,且计算高度集中于进入时刻的单个隐藏状态转换。这意味着隐藏状态循环推理不再是黑箱,而是可观测、可干预、可解释的内部推理机制。

方法

整体流程

给定一个推理问题文本,SWITCH 框架在生成过程中可以动态地在可见推理(生成自然语言词元)和潜在推理(通过隐藏状态循环)之间切换。整个方法基于一个核心观察:一对显式的边界词元 <swi></swi> 既能解决潜在模块与标准 on-policy RL 的兼容性问题,又为机械论分析提供了自然的因果干预锚点。

关键模块与训练

  1. 可切换的潜在推理机制
    模型在生成时若发出 <swi>,则进入潜在模式:停止生成可见的文本 token,转而将当前的隐藏状态反复输入下一层(或相同层)进行循环计算。经过预设的潜在步数后,模型发出 </swi> 退出潜在模式,重新开始正常的文本生成。这种循环仅在隐藏状态空间中进行,不产生任何可见 token,从而压缩了推理链的显式长度。

  2. 课程式有监督微调(Switch-SFT)
    为了让模型学会何时以及如何使用潜在模式,训练分为两个课程阶段:

    • 阶段一(定位切换位置):在完整的可见推理链中,通过启发式规则(如语义边界)标注出最适合切入潜在推理的位置,并插入 <swi></swi>,构造伪潜在轨迹用于初步微调。
    • 阶段二(潜在课程):逐渐将可见推理链的中间部分替换为隐藏状态循环,从全可见过渡到部分潜在、最终到全潜在,形成可见到潜在的课程,让模型平稳适应压缩推理。
  3. Switch-GRPO:潜在探索与精调
    有了边界 token 后,标准 GRPO(Group Relative Policy Optimization) 可直接应用于包含潜在块的序列。训练时,模型为每个问题采样多条生成轨迹,根据正确性与格式规则计算奖励(包括答案正确性、是否使用了 <swi> 等)。策略比率π_θ / π_old)在 <swi></swi> 处均明确定义,因此可以计算标准的 clipped surrogate loss。此外,梯度通过循环隐藏状态反向传播,使得潜在步骤也能被端到端优化。奖励中还加入了长度惩罚,鼓励模型仅在必要时使用潜在模式,避免滥用。

输出

最终模型能自主决策何时进入潜在模式,在隐藏状态中完成关键推理后退出,并产出简短精确的答案。与纯可见推理相比,SWITCH 在保持或提升准确率的同时显著压缩了解码长度。

与同类方法(如 Coconut)的差异:Coconut 等早期工作将整个推理链完全替换为连续循环,导致 RL 训练时策略比率在潜在部分未定义,且难以进行直接因果干预。SWITCH 通过引入离散的开关 token,将潜在块“包装”为常规序列的一部分,从而同时获得了标准 on-policy RL 的可训练性和清晰的因果分析接口

实验

实验设计

模型以 Qwen3-8B 为基础,使用 可见到潜在 的课程训练策略:首先通过监督微调定位 <swi></swi> 的插入位置,再逐步压缩推理链,最终用 Switch-GRPO 进行在线策略强化学习微调。评估主要针对数学推理任务,与 COCONUTCODI 等隐藏状态递归方法及纯可见推理基线比较,在类似规模下衡量推理准确率与压缩效率。

关键发现

  1. 性能提升:SWITCH 在所有评估基准上一致超越先前潜在推理方法,且 Switch-GRPO 阶段在课程学习之上带来额外增益。
  2. 不是风格化产物:探测与因果干预表明 <swi> 是一个 尖锐局部化的学习切换策略,而非无意义的文本模式。
  3. 潜在步骤确实参与推理:潜在模式下的隐藏状态执行 问题特定的因果重要计算,且该计算集中于 进入潜在模式时的单个隐藏状态转换,验证了潜在推理的实质作用。
  4. RL 训练改善内部机理:强化学习不仅提升表面性能,还使模型内部计算更高效,外部行为与内部表征协同进化。

与基线方法的对比解读

COCONUT 等现有隐藏状态递归方法相比,SWITCH 有两个根本性突破:

  • RL 兼容性:COCONUT 缺乏离散边界,导致在 on-policy RL 中难以定义策略比和梯度传播;SWITCH 将潜在块通过 <swi></swi> 显式锚定,使 GRPO 等标准算法可以直接应用。
  • 可解释性:边界标记同时为 机理分析 提供天然抓手,让潜在步骤的内部计算变得透明可测,而 COCONUT 的连续状态难以因果干预。

这一设计使得潜在推理首次同时满足 RL 可训练直接可解释 两大工程需求,为压缩推理在实际系统中的部署提供了更可靠的框架。

行业影响

落地场景

SWITCH 框架为大语言模型推理提供了一种可切换的潜在推理模式。在需要多步推理但无需展示中间过程的场景下,模型通过 <swi></swi> 边界令牌进入连续隐藏状态递归,压缩可见思维链,显著降低 token 开销与响应延迟。潜在推理通过 GRPO 在线策略强化学习直接优化,能自适应学习推理切换时机。

典型应用包括:

  • 代码辅助:复杂算法生成时,隐藏中间推导步骤,直接输出最终代码,保护 IP 的同时提升交互效率。
  • 数学问题求解:自动解题系统用潜在状态完成深层计算,仅返回答案,适合教育产品中的即时反馈。
  • Agent 任务规划:代理在思考行动序列时,用潜在模式快速迭代,减少冗余上下文窗口占用。

商业价值

  • 降本:可见推理令牌的压缩直接减少 API 调用成本,在规模化部署中效果显著。
  • 增收:更低延迟带来流畅体验,有助于提升用户留存与付费转化,尤其在实时对话与自动补全产品中。
  • 体验提升:隐藏中间推理使输出更聚焦于最终答案,符合大多数终端用户对简洁响应的预期,同时边界令牌的存在为合规审计提供了可解释性入口。

与现有产品/工作流的接口

SWITCH 仅在词表中增加两个特殊令牌,不改变 Transformer 架构,可无缝集成进现有 LLM 微调流程:

  1. 冷启动课程学习:先用含边界令牌的思维链数据做 SFT,定位切换点,再用 GRPO 进行在线探索优化。
  2. 与控制流框架兼容:边界令牌作为普通离散 token,与 vLLM、TGI 等推理引擎中的停止/生成条件控制天然适配。
  3. 可插拔推理模式:可将 SWITCH 封装为推理引擎的一个可选功能,由业务方根据任务需求动态开启,无需重新训练基础模型。

具体落地用例

  • 电商智能客服:当用户询问组合优惠、多件折扣等需要多步计算的问题时,模型自动切入潜在推理,快速产出生效价格,避免展示中间计算过程,既保护商业规则又提升对话效率。
  • 金融研报生成:自动生成分析报告时,模型在数据处理与合规校验阶段使用潜在推理,仅输出终版解读文本,降低了内部逻辑外泄风险,同时提高每分钟处理报告的数量。

局限

  • **对 token 化边界的依赖**:SWITCH 的核心设计依赖于显式边界 token `<swi>` 和 `</swi>` 来划定潜在推理窗口。这种 token 化方案虽然使 GRPO 策略比可定义,但也意味着潜在推理的长度受限于窗口内的固定隐藏状态步数,且无法动态适应问题复杂度。若窗口太短,可能压缩掉关键推理步骤;若太长,则引入冗余计算和训练开销。此外,该设计对自回归语言模型是一种“侵入式”修改,边界 token 本身需要作为额外词汇加入,增加了部署时的序列长度和推理延时,与追求高效压缩的初衷存在张力。
  • **仅在 LoRA 微调级别验证**:本文的核心实验均在 Qwen3-8B 模型上使用 LoRA 进行参数高效微调,尽管展示了稳定的提升,但尚未验证全参数微调或不同规模模型上的扩展性。LoRA 的低秩约束可能限制了模型学习复杂潜在策略的表示能力,训练稳定性和最优超参(如潜在步长 K_min)是否随模型规模变化仍是未知。对于期望在更大模型(如 70B+)上实施该技术的从业者,缺乏指导。
  • **可解释性分析仅限于浅层关联**:论文的机制分析虽然揭示了 `<swi>` 作为尖锐切换策略、潜在步骤在因果上重要,但分析手段(线性探针、mean ablation)相对基础,未能深入解释潜在状态内部如何编码并结构化推理逻辑。例如,潜在状态是否实现了类似显式思考链中的符号操作或抽象子目标,仍不明确。这对于真正理解 RL 如何从内部改进模型而言,是一个较大的缺口,限制了该框架在需要高可靠性可解释推理场景中的直接应用。
论文Jiayu Yang2026-06-11原文

相关内容