论文

从看见到思考:解耦感知与推理提升视觉语言模型的后训练

从看见到思考:解耦感知与推理提升视觉语言模型的后训练

近期视觉语言模型(VLM) 强调长链思维推理,但我们发现其视觉任务表现主要受限于视觉感知不足而非推理能力本身。 本文系统研究 VLM 后训练中感知与推理的相互作用,将能力分解为三个阶段:视觉感知、视觉推理和文本推理,并分别使用专门数据进行训练。我们证明视觉感知(a)需要专门优化,(b)是基础支架,应在视觉推理细化前通过分阶段训练巩固,且(c)通过强化学习(RL) 比基于描述的监督微调(SFT) 更有效。 在多个 VLM 上的实验表明,分阶段训练相比混合训练一致提升视觉感知与推理性能。值得注意的是,采用本方法的模型推理准确率提高 1.5%,推理链长度缩短 20.8%,表明更优的感知减少过度推理需求。此外,基于能力的分阶段训练代表一种新的课程维度,与传统的基于难度的课程正交,两者结合带来额外增益。本模型在开放权重 VLM 中达到领先水平,在 WeMath 和 RealWorldQA 等视觉数学和感知任务上比基线分别提升 5.2% 和 3.7%。

论文精读

TL;DR 通过将 VLM 后训练解耦为视觉感知、视觉推理和文本推理三阶段,并优先强化视觉感知,显著提升推理准确率并缩短推理链,在多个基准上取得最优。

问题

问题背景 当前大规模视觉-语言模型(VLM)在复杂视觉推理任务中,普遍引入长链式推理(Chain-of-Thought),试图通过详尽的语言化思考弥补视觉理解的不足,但往往忽视了底层视觉感知模块本身的性能瓶颈。

现有方法局限 主流VLM后训练通常将视觉感知与推理能力统一在一个微调阶段,采用混合数据直接指令微调(SFT)或强化学习(RL)。这种做法存在两方面局限:

  • 优化目标冲突:感知(如物体识别、空间关系提取)与推理(如数学计算、逻辑推演)对特征表征的需求不同,统一训练难以针对各自分别调优,容易导致模型过度依赖“想得多”来补偿“看不清”,使推理链冗长却无法提升准确率。
  • 数据与训练策略不匹配:感知任务需要稠密、细粒度的视觉监督信号,而普通图文描述数据缺乏对视觉细节的专门强化;若与推理数据混合训练,感知能力常被稀释,成为系统短板。

为什么这个问题难且重要 解耦感知与推理的后训练面临双重挑战:(1)必须构造专门聚焦视觉感知的高质量训练数据,并设计合理的阶段顺序,使感知能力先于推理固化;(2)需要验证哪种训练策略(RL vs SFT)更适合感知注入,以及该阶段是否与后续推理训练兼容。其重要性在于,扎实的感知是高效推理的基础:实验表明,强化感知后模型不仅准确率提升(+1.5%),推理长度反而缩短20.8%,即“看得清”能直接减少“想得多”。这一发现为多模态大模型的后训练范式提供了新方向——从追求推理链的长度,转向夯实感知根基。

行业类比 等同于自动驾驶系统必须先稳定识别车道线和障碍物(感知),再规划行车路径(推理);若感知模块抖动,上层决策再复杂也难以保证安全——视觉感知是智能体交互物理世界的基石。

核心洞察

  • 将视觉感知与推理能力解耦,揭示了当前 VLM 在视觉任务上的瓶颈主要在于感知而非推理,这挑战了主流研究一味追求长链思维(CoT)的趋势。该发现指出,强化模型的“看”能力可能比扩展“想”能力更有效地提升下游表现,为后训练资源分配提供了新方向。
  • 提出一种按能力(感知→视觉推理→文本推理)分阶段的课程学习策略,与传统的难度递进课程正交。实验证明,将感知阶段前置并单独优化,不仅提升最终推理准确性,还显著缩短推理链长度,表明更好的感知能减少冗余推理。这为多模态训练提供了新的课程设计维度,可叠加难度课程以进一步增益。

方法

核心思路:解耦感知与推理的分阶段后训练

本方法针对视觉-语言模型(VLM) 的后训练,将能力划分为三个独立的维度:视觉感知(visual perception)、视觉推理(visual reasoning)和文本推理(textual reasoning),并按顺序分阶段优化,取代传统的将所有数据混合训练的合并训练(merged training)范式。

数据构造与训练流程

  1. 数据准备

    • 感知数据合成:生成专门用于提升视觉细粒度理解的数据,并通过难度过滤(difficulty filtering)筛选出对模型当前能力具有挑战性的样本,确保数据在感知维度上的针对性。
    • 推理数据策展:分别构建视觉推理(如图表问答、几何题)和文本推理(多步逻辑链)的数据集,每种数据专门服务于对应阶段。
  2. 三阶段训练流水线

    • 阶段一:视觉感知训练:仅使用感知数据对模型进行后训练,优先巩固对图像细节的准确捕获。实验发现,基于视觉反馈的强化学习(RLVR) 比传统的基于描述的监督微调(SFT) 更有效,能直接优化感知质量。
    • 阶段二:视觉推理训练:在感知能力稳固后,加入视觉推理数据,让模型学习如何基于可靠的感知进行逻辑推演。此时感知模块已作为"基础支架",避免推理阶段对感知的持续误导。
    • 阶段三:文本推理训练:最后加入纯文本推理数据,进一步提升模型在多步推理、数学等任务上的泛化能力,并与前期视觉能力形成互补。

输出与效果

经过分阶段训练,模型在视觉数学和感知基准(如 WeMathRealWorldQA)上取得了显著提升(分别 +5.2% 和 +3.7%),同时推理轨迹长度缩短 20.8%,表明更精准的感知减少了不必要的推理冗余。

与同类方法的差异

不同于常见的难度课程学习(仅按样本难度排序),本方法引入了能力维度的课程(capability-based curriculum),将感知-推理作为新的调度维度,且二者正交互补;并且首次系统验证了RL 在 VLM 感知后训练中的独特优势,而多数后训练工作仍以 SFT 为主。

实验

实验设计

作者将 VLM 后训练解耦为三个阶段:视觉感知视觉推理文本推理,分别构建专门数据。阶段训练顺序固定为感知→视觉推理→文本推理(perception-first),并与将所有数据混合的 merged training 基线对比。此外,还在感知阶段比较 RL (RLVR)SFT (caption-based) 的效果,并探索此 capability-based stagingdifficulty-based curriculum 的叠加收益。

关键发现

  1. 感知专项训练不可或缺:通用 caption 数据不足以优化视觉感知,需用高质量感知数据并采用 RL 训练。
  2. 分阶段训练显著优于混合训练:多个 VLM 家族上,感知和推理指标均一致提升。
  3. 感知优先带来效率增益:更强的感知减少了后续推理的冗余,推理准确率提升 +1.5%,同时推理链长度缩短 20.8%
  4. 能力课程与难度课程正交:两者组合可进一步叠加收益。

基线对比解读

相较直接混合所有数据的标准后训练流程,分阶段训练显式解耦了“看”与“想”的协同。感知作为前置 scaffold 的强化,使模型在推理时不再需要补偿感知欠缺,从而产生更短、更精准的推理链。这一设计在 WeMath(+5.2%)和 RealWorldQA(+3.7%)等视觉密集型任务上尤为突出,表明对于当前 VLM,提升视觉感知的边际收益大于无差别堆叠推理数据。同时,RL 在感知阶段的效果优于 SFT,为后续 VLM 训练范式提供了新的探索方向——能力维度的课程构建可与已有难度课程灵活组合,赋予训练流程更精细的调控手段。

行业影响

落地场景

分阶段后训练方法 可直接应用于多模态对话系统、视觉搜索、文档解析、工业质检、医疗影像辅助诊断等产品。例如,在电商视觉搜索中,用户拍摄商品图片进行相似款查找或属性提问,模型需要先精确感知纹理、logo、形状等细节,再推理品类与风格;分阶段训练可显著提升细粒度识别准确度。在自动驾驶感知模块,对交通标志、障碍物的感知必须高度可靠,RL guided perception 训练有助于降低误检,并缩短推理链,满足实时性要求。

商业价值

  • 降低推理成本:实验显示推理 trace 缩短 20.8%,同等硬件可支撑更高并发,直接减少 API 调用开销与云端算力成本。
  • 提升准确率与用户体验:在 WeMath 等视觉数学任务上 +5.2%,RealWorldQA 上 +3.7%,更高的一次通过率意味着更少重试和用户流失。
  • 训练效率优化:将感知与推理解耦后,可针对不同能力复用或独立迭代数据与算力,避免冗余训练,缩短模型迭代周期。

与现有产品/工作流的接口

该方法属于后训练优化,可无缝集成到现有 VLM 训练流水线中:

  1. 基于已有的基础 VLM(如 LLaVA、Qwen-VL 等),构建专门化的感知数据集与推理数据集。
  2. 采用 RLVR 对视觉感知阶段进行强化学习,替换或补充传统 caption-based SFT。
  3. 感知 → 视觉推理 → 文本推理 的顺序分阶段微调,或将其作为难度课程之外的额外维度组合使用。
  4. 输出模型可直接替换线上服务模型,无需改动推理架构。

具体案例

  • 内容审核平台:先利用 RL 优化的感知模型精准识别暴力、色情等敏感视觉元素,再由推理模块结合上下文判定违规等级,减少误封和漏放,提升审核效率。
  • 教育科技产品:在拍照搜题应用中,引入分阶段训练的 VLM,先感知图表结构、手写公式细节,再推理解题步骤,可大幅提升复杂题型(如几何题)的解答率,缩短推理响应时间,改善学习体验。

局限

  • **数据合成与筛选的依赖性与泛化边界**:论文中视觉感知阶段的训练数据通过专门的合成流程生成,并使用感知难度过滤器进行筛选。这引入两个潜在问题:一是合成数据的分布可能无法覆盖真实世界丰富的视觉概念和噪声模式,导致感知能力提升局限于特定场景;二是难度过滤器本身依赖于预定义的启发式规则或模型判断,可能引入系统性偏差,忽略某些重要但低难度的感知维度。虽然实验证明了在 WeMath、RealWorldQA 等基准上有效,但当面对分布外或需要细粒度感知的任务时,该策略的泛化性仍待检验。此外,论文未详细探讨合成数据规模与质量之间的权衡,以及不同数据配比对最终性能的敏感性。
  • **分阶段训练的工程开销与最优排序**:将后训练分解为视觉感知、视觉推理、文本推理三个阶段,虽然带来了性能提升,但也显著增加了训练流程的复杂度与计算开销。每个阶段均需独立准备数据、设定超参数并可能进行多次试验以确定最优顺序。论文指出阶段顺序至关重要,但并未提供系统性的排序原则或自动化搜索方法,实际应用时仍需大量消融实验。另外,当前实验只在一组固定顺序下验证,若模型架构或预训练权重发生变化,最优阶段划分和顺序可能需要重新探索,这限制了方法作为通用插件(plug-and-play)的便捷性。
  • **实验模型与任务的覆盖范围有限**:实验主要在几款开源视觉语言模型(如 LLaVA 系列)上进行,且基准测试多集中于视觉数学和现实世界问答类任务。未与当前最先进的商业闭源模型(如 GPT-4V、Gemini Pro Vision)进行直接对比,因此“在开源模型中取得领先”这一结论的外部有效性存疑。更重要的是,分阶段训练的核心主张——视觉感知是推理瓶颈,且解耦训练优于联合训练——是否在更大规模模型(如数十亿参数以上)或更复杂的多模态任务(如视频理解、具身交互)中依然成立,论文没有提供充分证据,实际的工程借鉴价值可能需要进一步验证。
论文Juncheng Wu2026-05-19原文

相关内容