论文

Perceive-to-Reason: 解耦感知与推理用于细粒度视觉推理

Perceive-to-Reason: 解耦感知与推理用于细粒度视觉推理

细粒度视觉推理对视觉语言模型仍具挑战,尤其当微小但关键视觉线索深埋于高分辨率图像中。现有方法依赖重复裁剪或测试时视觉搜索引入局部证据,但通常未明确区分感知与推理。 本文提出统一框架 Perceive-to-Reason (P2R),将细粒度视觉推理形式化为两阶段过程:模型先作为 Perceiver 定位问题相关证据,再作为 Reasoner 基于标注图像与裁剪区域回答问题。为更好对齐训练与解耦范式,进一步引入 Perception-Reasoning Alternating GRPO (PRA-GRPO),一种角色感知强化学习策略,仅利用最终答案监督交替进行感知聚焦与推理聚焦更新。 基于 Qwen3-VL-Instruct-2B/4B/8B,P2R 在各规模模型上一致提升性能。其中 P2R-4B 在 V-Star 达 93.2%,在 HR-Bench-4K 达 81.9%,在 HR-Bench-8K 达 80.5%,显著优于对应骨干网络。实验表明 P2R 优势从高分辨率基准扩展至更广泛多模态推理任务,显式解耦感知与推理为细粒度视觉推理提供了有效框架。

论文精读

TL;DR P2R 将细粒度视觉推理拆解为感知定位与答案推理两阶段,通过交替强化学习在无需额外标注下显著提升高分辨率任务性能。

问题

问题背景

视觉语言模型在细粒度视觉推理任务中面临核心挑战:高分辨率图像中的微小关键线索(如文字、标志)难以被准确捕捉与理解,直接影响模型对复杂场景的可靠判断。

现有方法局限

现有方法多采用重复裁剪测试时视觉搜索来获取局部细节,但存在两个根本局限:

  • 感知与推理耦合:模型将证据定位和逻辑回答混为一体,缺乏专门化的感知模块,导致定位精度不足;
  • 优化目标单一:基于最终答案的监督信号无法显式引导模型改善感知行为,容易使模型忽略关键区域或过度关注背景噪声。

为什么这个问题难且重要

  • 技术挑战:关键证据可能仅占图像像素的极小比例,且易与背景混淆,要求模型同时具备细粒度感知和上下文推理能力。传统端到端训练难以平衡两者,计算开销与精度难以兼顾。
  • 业界关注度:在医疗影像分析工业质检自动驾驶等场景中,细粒度视觉推理是决策正确性的基石,错误可能引发严重后果。提升此类能力是推动多模态模型向高可靠工业应用演进的关键瓶颈。

行业类比

类似于自动驾驶系统先精确识别远处交通标志再做行车决策,将感知与推理解耦可让视觉智能体像人一样“先看清、再想透”,大幅提升复杂场景下的可信度。

核心洞察

  • 解耦感知与推理的流水线设计使视觉推理更精准且可解释:现有方法通常将证据定位与问题回答耦合在单次前向中,或依赖隐式的注意力机制,容易遗漏高分辨率图像中的微小关键线索。P2R 将过程显式分为 Perceiver 定位证据、Reasoner 基于标注图像与裁剪区域作答,既避免了大量重复裁剪的计算开销,又为推理提供了可审计的视觉锚点。这种结构性的分离让模型行为更透明,并大幅提升了在小目标判别任务上的准确率。
  • PRA-GRPO 通过角色感知的交替强化学习实现了仅靠答案监督的端到端解耦训练:与依赖人工标注边界框或昂贵过程监督的方法不同,P2R 引入的角色交替 GRPO 只使用最终答案正确性作为奖励,交替冻结 Perceiver 或 Reasoner 来分别优化定位与推理能力。这种训练策略不需要额外标注,却能让共享参数的视觉定位网络自发涌现出问题驱动的证据提取行为,显著降低了细粒度视觉推理的监督成本,展现出强化学习在多阶段视觉推理框架中的应用潜力。

方法

核心流程:从感知到推理的解耦

P2R 框架将细粒度视觉推理定义为两阶段串行过程

  1. 输入:高分辨率图像 (I) 与自然语言问题 (Q)。
  2. Perceiver 阶段:模型以“感知角色”运行,接收 (I) 与 (Q),输出问题相关证据的定位标记(如边界框坐标),并在原图上绘制标记以生成 感知增强图像 (I_{annot}),同时输出裁剪后的局部区域 (I_{crop})。该阶段仅关注“在哪里看”,不回答问题。
  3. Reasoner 阶段:模型切换为“推理角色”,输入变为 (I_{annot})、(I_{crop}) 与 (Q),基于完整上下文输出最终答案 (A)。

两阶段共享同一视觉 - 语言骨干网络(如 Qwen3-VL),不引入额外模块,但通过角色指令前缀区分行为:Perceiver 提示词强调“定位线索”,Reasoner 提示词强调“给出答案”。

训练策略:PRA-GRPO

为匹配解耦推理范式,作者提出 Perception-Reasoning Alternating GRPO (PRA-GRPO),一种仅用答案弱监督的强化学习方法:

  • 交替优化:每次迭代随机采样两条轨迹——一条完整的 Perceiver→Reasoner 路径,另一条仅包含 Reasoner 而跳过 Perceiver(将原始图像直接送入 Reasoner)。两个任务共享模型参数,但通过不同的奖励信号(均基于答案正确性)计算策略梯度。
  • 角色感知 GRPO 目标:Perceiver 的奖励基于其定位区域是否被成功利用于后续推理(间接通过最终答案正确性衡量),Reasoner 的奖励直接与答案准确性挂钩。这样无需框标注即可驱动定位行为。
  • 对比 GRPO 变体:与 DAPO 等基线相比,PRA-GRPO 放弃 token-level 信用赋值,完全依赖答案级反馈,更适合端到端交替训练。

输出

最终模型能够同时执行感知和推理,且两个角色可在同一推理管线中串联,无需外部工具或多次调用。

与同类方法的差异点:与依赖重复裁剪或测试时搜索的方案不同,P2R 在单一模型内显式解耦“看”与“想”,并通过交替 RL 训练统一优化,避免多模型级联带来的效率与适配成本。

实验

实验设计

P2R 框架基于 Qwen3-VL-Instruct-2B/4B/8B 构建,推理阶段分解为 感知 (Perceiver)推理 (Reasoner) 两步:首先感知器定位问题相关的视觉证据并生成标注与裁剪区域,然后推理器根据增强的图像和裁剪区块给出最终答案。训练采用 PRA-GRPO 策略,交替进行感知聚焦与推理聚焦的强化学习更新,仅依赖最终答案监督信号。模型在 V-StarHR-Bench-4K/8K 等高分辨率细粒度基准及通用多模态推理任务上评估。

关键发现

  • 跨模型规模一致提升:P2R-4B 在 V-Star 达 93.2%,HR-Bench-4K 81.9%,HR-Bench-8K 80.5%,均大幅超越同规模 backbone。
  • 泛化性得到验证:P2R 的优势不仅局限于高分辨率场景,还扩展到更广泛的多模态推理任务,表明解耦范式具有普适性。
  • 训练效率:PRA-GRPO 交替优化避免了感知和推理学习间的干扰,无需额外监督即实现高效训练。

与基线对比解读

不同于依赖重复裁剪或测试时搜索的现有方法,P2R 通过显式解耦感知与推理,避免了将细微视觉线索的发现与逻辑推演混为一谈。两阶段设计使得模型能够专注于定位关键证据(如局部文字或细节),再基于标注信息进行推理,从而在高分辨率细粒度任务上表现出显著增益。PRA-GRPO 的角色感知交替更新进一步巩固了这一优势,在 V-Star 等基准上大幅领先 backbone(提升幅度未给出具体百分比,但结果为大幅超越)。这种“先定位再推理”的范式为细粒度视觉推理提供了更清晰的归纳偏置,并展现出良好的迁移能力。

行业影响

落地场景

P2R 框架将视觉感知与推理解耦,尤其适用于需要从高分辨率图像中定位微小视觉线索的任务。典型应用包括:

  • 医疗影像分析:在病理全切片或放射影像中自动标注可疑病灶,降低漏诊率。
  • 自动驾驶:从高分辨率前视图像中识别远距离交通标志或细小障碍物。
  • 工业质检:检测 PCB 板、纺织品表面的微观缺陷,减少人工复检成本。
  • 电商内容理解:从商品详情图中提取材质标签、尺寸表等细粒度信息,自动生成结构化数据。
  • 文档智能:对扫描合同、报表中的小字体表格和印章进行定位与识别。

商业价值

  • 降本:自动化细粒度视觉分析流程,减少对昂贵人工审核的依赖(如医疗器械标注、工厂质检员)。
  • 增收:在电商搜索推荐中,更准确的理解商品属性可提升匹配精准度,直接拉动转化率;在广告投放中,根据图像内容更细粒的定向提升 eCPM。
  • 体验提升:智能客服、教育应用中,用户上传图片提问时,模型能聚焦关键区域给出可靠答案,减少反复确认的摩擦。

与现有产品 / 工作流的集成

P2R 基于 Qwen3-VL 等主流 VLM 构建,训练后可直接替换原有视觉推理模块,无需大幅改造推理管线。集成方式灵活:

  • API 化部署:封装为视觉推理服务,接收图像+文本查询,输出答案及感知边界框,供上游业务调用。
  • 多智能体框架:作为 LangChain 或 AutoGen 中的一个专用视觉节点,对外提供「定位-回答」的标准接口。
  • 增量增强:现有 VLM 通过 PRA-GRPO 微调后,只需在 prompt 中增加 <perceive><reason> 角色标记即可触发两阶段推理,改动成本极低。

具体落地 Use Case

  1. 电商商品信息自动填充
    卖家上传高分辨率产品图后,系统调用 P2R 先定位吊牌、成分标签区域,再提取文本内容。与传统 OCR 相比,P2R 能应对反光、遮挡、弯曲等复杂情况,将人工补全字段的时间从平均 2 分钟/件降至 10 秒内,并保证 95% 以上准确率。

  2. 远程病理会诊平台
    病理医生面对数字切片图像时,系统自动勾画可疑核分裂象或微血管区域,并按置信度排序呈现。P2R 的显式感知步骤提供了可解释的视觉依据,使诊断报告可追溯,培训初级医生时也可直接复用高亮区域作为教学案例,缩短培训周期。

局限

  • - **两阶段推理增加计算开销**:P2R 推理时先由 Perceiver 进行视觉感知、标注图像并生成裁剪区域,再交由 Reasoner 进行推理,相当于两次模型前向或额外后处理。尽管附录 E.2 对效率做了分析,但未与单阶段模型进行端到端延迟对比;在实时应用或高吞吐场景下,这种设计可能成为瓶颈,限制了实际部署的可行性。
  • - **感知质量依赖性强**:Reasoner 的推理严重依赖 Perceiver 输出的边界框质量和区域裁剪完整性。若 Perceiver 定位不准确或遗漏关键证据,错误将累积传播,而论文未对感知失败案例进行定量分析,也未评估这种传播对最终答案的影响,模型在复杂场景下的鲁棒性缺乏实验支撑。
  • - **训练策略潜在不稳定**:PRA-GRPO 仅以最终答案正确性为奖励,交替优化感知与推理阶段,感知阶段缺乏直接的定位监督,在训练早期探索不足时难以快速收敛。交替更新的频率、奖励缩放等超参数可能对训练结果敏感,但论文未深入探讨这种敏感性及其在不同任务下的泛化表现。
论文Hongxing Li2026-07-01原文

相关内容