论文

搭建思维脚手架:优化多模态推理中的潜在视觉目标表示

搭建思维脚手架:优化多模态推理中的潜在视觉目标表示

潜在推理 通过两阶段训练范式推进了多模态推理:(1) 在监督微调(SFT)阶段,将一张 helper image 编码为潜在 token,以教授视觉思维链;(2) 在强化学习(RL)阶段,利用奖励反馈进一步精炼这些潜在 token。本文指出该框架在两个阶段各存在一个关键局限: 1. SFT 阶段的表示次优:该阶段通常依赖现成的视觉编码器来编码 helper image,得到的潜在表示并非最优,可能与下游推理任务对齐不佳。 2. RL 阶段的探索受限:现有 RL 方法仅通过确定性正则化处理潜在成分,只约束了策略漂移,却无法生成可供探索的替代潜在轨迹。 为此,我们提出 Scaffolding Minds:学习一个专用的 scaffolding encoder,在潜在空间中提供优化后的目标;同时学习 RL 采样器的均值与方差。我们进一步表明这两项改进具有互补性,结合后可对强基线取得显著提升。 实验上,本方法在 FrozenLake 空间规划任务上相较最强潜在推理基线提升 +9.5 分,在 32x32 网格上升幅扩大至 +19 分;在九个以视觉为中心的推理基准上平均提升 +5.6 分。

论文精读

TL;DR 本文提出 Scaffolding Minds,针对多模态推理的 latent reasoning 两阶段训练:SFT 阶段学习专用 scaffolding encoder 优化潜在视觉目标,RL 阶段学习均值和方差增强探索,二者互补,在 FrozenLake 和视觉推理基准上大幅超越最强基线。

问题

多模态推理领域正从显式思维链转向隐式推理(latent reasoning),借助 latent tokens 承载视觉中间表示以提升推理效率与泛化能力。

现有两阶段范式(SFT + RL)存在两个环节的缺陷:

  • SFT 阶段:直接使用现成视觉编码器(如 CLIP/SigLIP)对 helper image 编码,其特征分布未针对下游推理任务对齐,导致 latent target 可能包含冗余或不相关的视觉信息,限制了后续策略学习。
  • RL 阶段:常用确定性正则化(如 KL 约束)只防止策略漂移,但未引入对 latent 采样的方差建模,探索局限于 teacher 提供的轨迹,无法发现更优的 latent 路径。

隐式推理的核心难点在于 latent 空间缺乏直接监督,需要同时解决 表示对齐 与 探索多样性 两个相互制约的目标。若表示不佳,RL 无法弥补;若探索不足,策略容易陷入局部最优。该问题直接影响多模态推理在空间规划、几何推理等任务上的性能上限,是当前 VLM 推理能力突破的关键瓶颈之一。

类似 RLHF 中需要专门训练 reward model 而非直接采用预训练分类器,隐式推理的 latent target 也需要定制化“脚手架”来引导探索,否则如同用通用地图在复杂地形中导航。

核心洞察

  • SFT 阶段应训练专用 scaffolding encoder 而非直接使用现成视觉编码器生成 latent 目标。现有 latent reasoning 方法依赖通用视觉编码器编码 helper image,假设其表征可直接迁移;但下游多模态推理需要任务特定的视觉抽象(如 FrozenLake 的价值函数热力图),通用编码器表征可能不对齐。端到端训练 scaffolding encoder 使 latent 目标与最终推理损失一致,能显著提升下游性能。
  • RL 阶段应显式学习 latent 采样器的方差以探索替代 latent 轨迹,而非仅用确定性正则化限制策略漂移。现有方法通过 KL 约束 latent 与参考分布,只防止偏移但不产生新的候选路径;学习均值与方差的采样器允许在优化奖励时采样多样化 latent 序列,增强探索能力,尤其在复杂空间规划任务中收益明显。

方法

方法概览

输入为多模态问题与辅助图像(helper image),输出为文本答案。方法分两阶段优化潜在视觉推理。

SFT 阶段:Scaffolding Encoder 学习优化潜在目标

  • 传统做法:用现成视觉编码器编码辅助图像得到潜在 token,作为 SFT 监督目标,但表示可能与下游推理任务错位。
  • 本方法:引入可训练的 Scaffolding Encoder,在 SFT 中联合优化。该编码器将辅助图像映射为潜在视觉目标表示(latent visual target),并以任务损失(如答案交叉熵)监督,使潜在 token 更利于后续推理。
  • 训练流程分两个子阶段:Scaffolding Phase 先训练 scaffolding encoder 产生高质量潜在目标;Latent-Prediction Phase 再让主 VLM 在给定问题与辅助图像时,预测这些潜在 token 并生成答案,通过预测损失(如均方误差)对齐目标。

RL 阶段:变分采样替代确定性正则

  • 现有 RL 方法仅对潜在部分使用固定 KL 正则,限制策略漂移但缺乏探索。

  • 本方法让策略输出潜在 token 的均值与方差,采用重参数化采样生成多条潜在轨迹,并用裁剪的重要性比率目标更新策略,在约束更新的同时鼓励多样探索。

  • 两阶段改进互补:更优的潜在目标加上更充分的潜在空间探索,共同提升多模态推理性能。

与同类方法的差异点:相比固定视觉编码器加确定性 KL 正则的基线,本方法在 SFT 与 RL 阶段分别引入可学习目标表示与变分采样探索,端到端优化潜在推理。

实验

实验设计

本文在两类任务上评估 Scaffolding Minds:

  1. FrozenLake 空间规划:覆盖 4x4 至 32x32 网格,验证潜在视觉目标表示在空间推理上的有效性。
  2. 视觉中心推理基准:合计 9 个 benchmark,衡量多模态推理泛化能力。

基线为当前最强的 latent reasoning 两阶段框架(SFT + RL),其中 SFT 使用现成 vision encoder,RL 采用确定性正则化。

关键发现

  • FrozenLake 上平均提升 +9.5 points,32x32 的复杂网格提升扩大至 +19 points,表明方法在空间复杂度增加时优势更明显。
  • 9 个视觉中心推理基准平均提升 +5.6 points,说明专用 scaffolding encoder 与 RL 方差学习具有跨任务迁移性。
  • 两项改进(SFT 视觉目标优化 + RL 采样方差学习)呈互补关系,组合后收益超过单独应用之和。

与基线的对比解读

现有框架在 SFT 阶段依赖现成 encoder,但编码的 helper image 表示与下游推理任务对齐不足;RL 阶段通过确定性正则化约束策略漂移,却未生成替代潜在轨迹,限制了探索空间。本文方法显式学习 scaffolding encoder 提供优化目标,并在 RL 中学习均值和方差,从而构建更丰富的潜在轨迹分布。这一改变在复杂空间规划(32x32)中带来近两倍的相对提升,体现出对探索能力与表示质量的双重改进。

行业影响

落地场景

该方法可直接用于需要视觉链式推理 的多模态产品:

  • 自动驾驶 / 机器人导航:在复杂路口或室内环境中进行空间规划 与路径决策,论文在 FrozenLake 任务上 +19 点(32x32)的提升表明对高精度地图理解有实际价值。
  • 电商视觉问答:用户上传商品图并提问("这件上衣搭配什么裤子?"),模型需生成 latent 推理步骤;本方法可提高属性推理与搭配建议的准确率。

商业价值

  • 降本:RL 阶段学习 latent 采样方差,允许更丰富的探索,可减少对大规模人工标注的依赖;同时推理阶段不增加额外计算(仅训练时引入 scaffolding encoder)。
  • 增收 / 体验:九个视觉推理基准平均 +5.6 点,直接降低错误率,减少客服转人工或用户流失。

与现有产品/工作流的接口

  • 可嵌入现有 VLM 的两阶段微调管线:SFT 阶段替换原有 vision encoder 为 scaffolding encoder,RL 阶段使用可学习均值和方差的采样器。
  • 与 LoRA 等参数高效微调兼容,无需改动推理架构;奖励模型可复用现有业务指标(如用户点击、任务成功率)。
  • 具体落地:在电商平台的商品问答模型上,先用少量 helper image 生成视觉 reasoning 标签,再通过本方法优化 latent target;在自动驾驶仿真环境中,用安全驾驶得分作为 reward 进行 RL 优化。

局限

  • **辅助图像质量依赖** 论文的 SFT 阶段依赖辅助图像来教授视觉链式思维,但辅助图像的生成方式(如 FrozenLake 中的 value-function heatmap)在真实视觉推理任务中难以获得同等结构化的信号。如果辅助图像本身存在噪声或偏差,scaffolding encoder 学习到的潜在表示可能被误导,导致整体推理性能下降。论文未系统分析辅助图像质量对结果的影响,也未给出在更一般场景下如何自动生成高质量辅助图像的方案,这限制了方法在开放域多模态任务中的直接适用性。
  • **计算与部署开销** 引入专用的 scaffolding encoder 并在 RL 阶段学习均值和方差,增加了模型参数量和训练复杂度。虽然附录可能报告了推理效率,但实际部署时该编码器是否必须在线运行、增加的延迟是否可接受,论文未明确讨论。此外,学习方差意味着 RL 采样过程可能需要多次采样以获得稳定估计,在推理时若保留随机性则会影响确定性输出,若仅使用均值则探索收益可能被削弱,这一设计选择缺乏充分消融。
  • **实验范围偏窄** 论文在 FrozenLake 合成空间规划任务和九个视觉中心推理基准上验证,但这些任务偏向空间与几何推理,对于需要更复杂语言-视觉交互的 benchmark(如 MMMU、MathVista 等)未做评估。与现有潜在推理方法的对比主要限于同框架内的强基线,未与更广泛的多模态推理 SOTA 方法(如基于显式 CoT 的模型)做横向比较,因此增益是否来自潜在推理本身的改进还是任务特化,仍存疑问。
论文Haoqiang Kang2026-09-29原文

相关内容