Equilibrium Reasoners: 学习Attractors 实现可扩展推理
扩展测试时计算通过迭代更新潜在状态已成为推理的强大范式,但其内部机制尚不明确。我们假设,可泛化推理源于学习任务条件吸引子(task-conditioned attractors):一种潜在动力系统,其稳定不动点对应有效解。 我们通过 Equilibrium Reasoners (EqR) 形式化这一过程,无需外部验证器或任务特定先验即可实现测试时扩展。EqR 沿两个维度扩展内部动力学:深度(更多迭代)和 广度(聚合多次初始化的随机轨迹)。实验表明,测试时扩展的收益与向解对齐吸引子的收敛强度紧密相关。 这种吸引子视角使神经网络能根据任务难度自适应分配测试时计算:简单问题在 1-5 步内收敛,而困难问题需大量扩展。通过展开等效于 40,000 层的迭代,潜在推理将准确率从前馈模型的 2.6% 提升至 Sudoku-Extreme 上的 99% 以上,表明学习的吸引子景观为理解迭代潜在模型的可扩展推理提供了有用的机制视角。
论文精读
TL;DR Equilibrium Reasoners 通过习得任务驱动的吸引子动态系统,将隐状态迭代收敛至有效解,实现无外部验证器的超深层(等效 40000 层)测试时扩展,在 Sudoku-Extreme 上将准确率从 2.6% 提升至 99% 以上。
问题
问题背景
当前推理范式正从固定计算向 测试时扩展(test-time scaling) 迁移,迭代更新隐状态成为提升复杂任务泛化能力的关键路径。
现有方法局限
主流迭代推理模型依赖外部验证器(external verifiers) 或任务特定先验(task-specific priors) 来引导搜索,训练与推理分离,泛化性受限于验证器质量。此外,内部动力学机制不明确,模型容易依赖记忆而缺乏系统化的问题求解能力。即使增加迭代步数,若隐状态未收敛到有效解,计算资源被浪费,且无法自适应调整深度。
为什么这个问题难/重要
推理任务需要从映射关系升维到求解过程,这要求模型学到任务条件化的吸引子(task-conditioned attractors)——即隐空间动力学将不同初始状态稳定地收敛到正确解。难点在于:
- 动力学设计:如何让迭代过程天然导向解而不依赖外部信号;
- 训练稳定性:深度展开(如等效40,000层)时的梯度与收敛平衡;
- 计算分配:如何根据难度弹性地分配测试时计算。 业界关注点在于自监督式推理架构能否替代搜索-验证范式,降低推理成本并提升可解释性。
行业类比
就像代码补全模型从单步生成到多步调试的进化,推理模型需要内在的“校对”机制,在迭代中自动修正中间状态,而非依赖外部评分器。
核心洞察
- 吸引子动力学将推理正确性内嵌为潜在空间中的收敛目标,模型无需外部验证器即可自检推理过程。与依赖过程奖励模型或树搜索启发式的可扩展推理方法不同,EqR 构造任务条件化的吸引子景观,使潜在状态的迭代更新自驱动地向正确解收敛;收敛程度直接反映推理置信度,省去了昂贵的外部标签和搜索设计,实现了端到端的自洽推理。
- 通过随机初始化和噪声注入塑造多盆地吸引子景观,EqR 能自适应地执行‘深度×广度’联合测试时计算扩展。传统迭代模型仅靠增加迭代步数提升性能,EqR 则进一步引入广度扩展:从多个随机初始状态出发并沿随机轨迹聚合,形成类集成但更高效的探索机制。这使得简单任务 1–5 步快速收敛,困难任务可扩展至等效 40,000 层网络,计算分配随难度动态调节,显著超越固定预算的前馈模型。
方法
Equilibrium Reasoners (EqR) 将推理问题转化为潜在状态在任务条件化动态系统中的吸引子收敛过程。
输入与状态初始化
模型接收任务实例 (x)(如数独盘面的 token 序列)和一个随机采样的初始潜在向量 (z_0)。z_0 从各向同性高斯分布中抽取,避免学习到退化固定点,迫使模型学习从任意起点均可收敛至解的全局吸引子盆地。
核心迭代模块
推理由一个权重绑定的迭代函数 (f_\theta) 驱动:
- 单步更新:
z_{t+1} = f_\theta(x, z_t),f_\theta 通常由 Transformer 块实现,任务表征通过交叉注意力注入。 - 深度缩放:重复应用 f_\theta 达 T 层(可多达等效 40,000 层),状态序列 {z_t} 向任务相关的不动点(吸引子)逼近,该不动点解码后即为有效解。
- 训练技巧:采用截断梯度(仅反向传播最后 K 步)以稳定优化;通过路径随机性(每步注入小噪声)平滑吸引子景观,扩大收敛盆地。
- 监督策略:损失可直接施加于最终状态或中间层,常用交叉熵比较模型输出与真实解。
测试时缩放与输出
- 广度缩放:同时运行多条不同随机初始化的轨迹,对最终输出或最后几层进行多数投票,提升稳定性。
- 自适应计算:根据当前步的状态残差 (|z_{t+1} - z_t|) 动态决定迭代终止,简单样本仅需 1-5 步,困难样本自动扩展至更大 T。
- 输出解码:取收敛后的潜在状态,通过简单的线性投影或规则解码得到任务解(如数独的完整赋值)。
与同类方法的差异
EqR 直接通过截断式迭代塑造吸引子景观,无需像深度均衡模型(DEQ)那样依赖隐函数求导与不动点求解器,同时通过随机初始化与路径噪声实现纯测试时缩放而不引入额外验证器或搜索机制。
实验
实验设计
实验核心围绕 Sudoku-Extreme 任务进行,该任务要求从残缺数字中推理完整数独解,推理难度极大。模型架构基于权重共享的迭代变换块,在 EqR 框架下不依赖外部验证器或任务先验,完全通过内部潜空间动力学演化求解。测试时计算沿两个维度扩展:
- 深度扩展:增加迭代步数,允许潜状态沿吸引子流形收敛至固定点;
- 广度扩展:从多个随机初始化出发,聚合不同轨迹以提升鲁棒性(类似多数投票)。
训练采用截断梯度、层次化迭代和自适应计算时间(ACT)策略优化收敛行为,并通过随机状态初始化和路径噪声注入塑造吸引子景观。
关键发现
EqR 的测试时扩展与收敛至解对齐吸引子的强度强耦合。 简单数独实例通常只需 1–5 步迭代即可收敛,而困难实例随着迭代步数增加显著受益:当展开至相当于 40,000 层时,准确率从前馈模型的 2.6% 提升至超过 99%。这说明潜状态动态系统确实学习到了以正确解为稳定不动点的任务条件吸引子,且吸引子盆域宽度与难度相匹配。
进一步分析表明,随机初始化与路径随机性是构建稳健吸引子的关键:单条轨迹可能陷入局部吸引子,但多轨迹聚合可显著提升最终解的质量。模型能根据任务难度自适应分配计算——对于容易实例快速收敛,对复杂实例则自动增加迭代。
与基线对比解读
基线前馈模型在 Sudoku-Extreme 上几乎完全失败(2.6%),突显纯前馈推理的局限性。相比之下,简单的无吸引子迭代模型(如权重共享循环网络)虽能获得一定提升,但缺乏收敛保证和扩展性。EqR 引入的显式吸引子视图通过塑造解空间能量景观,使得即使非常深的展开也不发散,并且与随机性相结合时,突破了之前迭代模型的性能上限。在相同计算预算下,EqR 的深度与广度结合策略远比单纯增加模型尺寸或迭代次数高效,表明 学习到的吸引子结构是通往可扩展推理的有效机制路径。
行业影响
本文提出的 Equilibrium Reasoners (EqR) 通过习得任务条件的吸引子(attractor)动力学,为推理任务提供了无需外部验证器即可弹性扩展测试时计算的新范式。这种机制对工业界的影响体现在:
落地场景
- 复杂结构化推理服务:如数学题自动求解、代码调试、逻辑谜题验证等。EqR 可在不改变模型结构的前提下,通过增加迭代步数或聚集多条随机轨迹,动态提升准确率,适用于对正确率要求高的教育、金融合规或企业自动化场景。
- 自适应算力分配系统:根据问题难度自动分配推理预算,简单问题快速收敛(1-5 步),困难问题可展开至等效 40,000 层网络。这对需要兼顾延迟与精度的在线服务(如智能客服、实时决策引擎)尤为实用。
商业价值
- 降低推理成本:相比传统方法依赖外部验证器或任务特定先验,EqR 通过内部吸引子收敛实现自我纠错,减少了多次采样与验证的开销。对于按调用次数或 token 计费的商业 API,可直接降低单位任务的算力消耗与延迟。
- 提升体验与可靠性:在 Sudoku-Extreme 任务上,准确率从传统前馈模型的 2.6% 提升至 99% 以上,展示了在高难度任务上提供可信输出的能力,可减少人工审核投入,提升产品竞争力。
与现有产品/工作流的接口
- 无缝集成推理 pipeline:EqR 可封装为一种
iterative_latent_reasoner模块,接受问题编码后的潜在状态,输出最终答案。现有自回归模型(如 GPT 系列)可将其作为插件式推理引擎,嵌入到思维链(chain-of-thought)框架中,替代部分显式生成推理步骤,减少上下文长度并提高可靠性。 - 与分布式推理框架兼容:EqR 的“广度扩展”(聚合多条随机轨迹)天然适合并行化,分布式推理系统(如 vLLM、Ray Serve)可直接将不同随机初始化分配给多个 worker,最终聚合结果,无需额外开发。
具体落地用例:
- 教育科技平台的自动批改系统:面对学生提交的复杂数学题或逻辑推理题,系统先通过轻量模型判断难度,简单题直接快速前向;难题启动 EqR 模式,自适应增加迭代步数,保证高正确率的同时控制平均延迟。
- 金融领域的合同条款一致性检查:输入合同文本与合规规则,EqR 在潜在空间迭代推理,判断是否存在冲突或遗漏。由于其不依赖外部裁判模型,可避免多模型间的不一致性,审计过程更透明、易解释。
局限
- - **任务泛化性有限**: 目前仅在 Sudoku-Extreme 等严格约束满足任务上验证,对于自然语言推理、数学证明或代码生成等开放域推理任务,吸引子假设是否成立尚不明确。此类任务解空间连续且非唯一,可能无法形成清晰的吸引子结构,导致方法难以直接迁移。
- - **训练稳定性与超参数敏感**: 依赖截断梯度、分层迭代和噪声注入来塑造吸引子景观,训练过程对学习率、迭代步数、噪声尺度等敏感,且论文未系统分析训练崩溃或收敛失败的边界条件,增加了工程复现与调优成本。
- - **推理计算开销与延迟**: 深度缩放(多达 40,000 等效层)和广度缩放(多次随机重启投票)显著提升推理成本,在低延迟场景(如实时对话)中难以实用。尽管可自适应分配,但动态调整机制本身引入额外控制逻辑,未与现有推理加速技术(如投机解码)结合优化。