论文

看见更多意味着知道更多吗?Mono-Anchored Advantage Normalization 用于多源视觉推理

看见更多意味着知道更多吗?Mono-Anchored Advantage Normalization 用于多源视觉推理

通过可验证奖励的强化学习(RLVR)进行视觉推理已取得显著进展。然而,现有方法在处理多源输入时,往往将其视为信息的简单累加,缺乏明确机制来区分整合额外源是带来信息增益还是引入干扰。因此,当多个源在物理属性和语义上差异显著时(例如红外和深度),它们难以有效建模动态交互,导致当某个源包含主导信号时,推理性能甚至不如单源推理。 为了解决这一问题,我们提出 MARS,一种新颖的单锚多源推理框架,将每个视觉模态建模为独立信息源。具体而言,通过将单源奖励作为动态锚点,我们的方法显式地将多源融合引入的信息增益纳入优势归一化,并在 RLVR 过程中自适应地强调源间的相互促进,同时抑制潜在的噪声或冲突。理论分析表明,我们的方法在梯度估计中有效量化了多源整合带来的信息增益,实现了一致的模态调节。 实验结果显示,在 GRPO 和 DAPO 上分别取得 3.2% 和 4.9% 的性能提升,跨多个数据集验证了方法的有效性。

论文精读

TL;DR MARS 以单模态奖励为动态锚点,量化多源信息增益并自适应抑制模态干扰,在多源视觉推理 RLVR 中分别提升 GRPO、DAPO 性能 3.2% 和 4.9%。

问题

多模态大模型(MLLM)的视觉推理正从直接预测转向可验证奖励驱动的强化学习(RLVR),以实现链式思维和复杂多步推理。然而,当前方法在处理多源输入(如 RGB、红外、深度图)时,普遍将其视为信息的简单堆叠,缺乏对信息增益与干扰的显式量化。这导致两个关键局限:

  • 聚合策略僵化:现有模型大多采用特征拼接或固定加权融合,无法根据语境动态评估每个源的信息价值。当某一源(如红外)提供主导信号时,其他源(如深度)可能引入噪声,但模型仍盲目融合,造成整体性能下降,甚至劣于单源推理。
  • RLVR 梯度估计失衡:优势函数(advantage)的归一化仅基于多源联合奖励,无法区分各模态的独立贡献,导致梯度更新时对干扰源缺乏抑制,对互补源缺乏强调。

该问题的难度在于:多源模态之间存在巨大的物理与语义差异,其交互具有高度动态性——同一模态在不同样本中可能从“有益”变为“有害”。在 RLVR 的探索-利用过程中,模型必须同时完成两个任务:识别当前上下文中各源的信噪比,以及将其稳定地编码到优势估计中。从产业角度看,多传感器融合广泛应用于自动驾驶、医疗影像分析、工业质检等场景。若融合策略不当,反而会降低系统可靠性,因此业界对能够自适应量化信息增益、抑制跨源冲突的方法有强烈需求。

一个直观的类比是:自动驾驶中的多传感器融合。若将摄像头、激光雷达、雷达数据简单拼接,雨天时雷达点云会严重干扰视觉特征,导致误检。MARS 的思想就像为每种传感器预先评估其单源可靠性,再在融合时动态调节权重,确保模型“不再盲目相信更多信息”。

核心洞察

  • MARS 将多源视觉推理从简单堆砌转变为基于信息增益的动态融合,通过单源奖励锚定,显式量化额外模态的贡献。传统 RLVR 方法不加区分地合并多源输入,无法应对模态间物理特性与语义差异带来的噪声或冲突,常导致性能劣于单源推理。MARS 提出用单源奖励作为动态锚,计算优势时纳入多源融合带来的信息增益,从而自适应地增强互补模态、抑制干扰模态,根本解决了“多即好”的认知误区。
  • MARS 在强化学习梯度估计中首次引入模态信息增益的量化,为多模态策略优化提供了可解释的调节机制。该方法从理论上推导出优势归一化中信息增益项的对齐效应,保证不同模态在训练中的贡献得到一致评估,避免了梯度信号相互抵消。这一设计不仅提升了性能,更使得模态重要性可追踪,为动态模态权重的工程部署提供了清晰的数学依据,有别于以往端到端黑盒融合的做法。

方法

多源推理的动机与挑战

多源视觉推理中,不同模态(如红外 RGB、深度)物理性质和语义差异显著,简单拼接常导致噪声干扰有效信号。现有方法缺乏显式机制判别融合是否带来信息增益,容易在某一模态占主导时性能反而不如单源。

单源锚定优势归一化机制

MARS 将每个模态视为独立信息源,核心创新是用单源奖励作为动态锚点量化多源融合的贡献。

  • 输入:多个视觉模态 {I_1, I_2, ...} 与文本问题。
  • 奖励建模:对每个样本,分别计算仅用单一模态的奖励 r_i 和融合所有模态的奖励 r_fuse。
  • 信息增益量化:定义增益 Δ = r_fuse − max(r_i),正值表示互补增益,负值表示干扰。
  • 优势归一化改造:将 Δ 融入策略梯度估计的优势函数 A(通常为 r − baseline)。例如 A ← A ⋅ φ(Δ) 或 A ← A + λΔ,使增益大的多源样本获得更高优势权重,负增益样本被抑制。
  • 梯度估计:修改后的优势直接影响梯度方向,在训练中自适应促进模态间相互增强、抑制噪声冲突,无需人工预设模态重要性。

理论意义

梯度分析表明,该方式能直接量化多源整合对策略改进的信息增益,保证模态调节在所有训练步中方向一致。

与同类方法的差异

此前方法多将多源输入视为信息累加,依赖固定拼接或简单加权;MARS 首次通过动态锚定的优势归一化,让模型根据实际融合效用自主调节各模态对学习的贡献,从根本上解决了多源集成中信息增益与干扰的自动权衡。

实验

实验设计

  • 针对多源视觉推理任务,对比 MARS 与直接将多源输入作为信息叠加的基线方法。
  • 采用两种强化学习算法:GRPODAPO,在多个包含异构模态(如红外、深度)的数据集上评估。
  • 核心机制:以单源奖励作为动态锚点,将多源融合带来的信息增益显式纳入优势归一化,自适应调节模态间交互。

关键发现

  • MARS 在两种 RL 算法上均取得稳定提升:GRPO 性能增益 +3.2%,DAPO 增益 +4.9%
  • 相比基线,MARS 能有效抑制噪声或冲突模态的干扰,同时放大互补信息的相互促进作用,即使当某一源提供主导信号时,也不会因融合而性能退化。
  • 理论分析证实,所提方法能通过梯度估计量化多源集成的信息增益,实现对每个模态的一致调控。

基线对比解读

  • 传统方法将多源输入简单累积,缺乏区分信息增益与干扰的机制,导致在部分模态不相关或噪声较大时性能甚至低于单源推理。MARS 的单源锚点策略从根本上解决了这一问题,通过优势函数中的动态归一化,隐式学习“何时依赖哪个源”,使模型在面对异构物理特性与语义差距时更具鲁棒性。从梯度估计角度看,MARS 的归一化项等价于在策略梯度中引入正则化,强制让优势估计反映信息增益,从而避免误导性更新。这一实验结果证实,在 RLVR 中显式建模多源交互的动态性是关键,而非简单堆叠数据。

行业影响

落地场景

MARS 框架专为多源视觉推理设计,能够动态判断不同视觉模态(如 RGB、红外、深度)的融合是否带来信息增益,尤其适用于自动驾驶、安防监控、医学影像分析等依赖多传感器融合的场景。在自动驾驶中,车辆需整合可见光、红外与深度数据,MARS 可避免阴天或夜间场景下某一模态的信号退化拖累整体决策;在医学影像中,CT 与 MRI 的联合分析常面临模态冲突,MARS 能自适应抑制噪声,提升诊断推理的准确性。

商业价值

MARS 通过奖励锚定(reward anchoring)优势归一化显式量化多源融合的信息增益,可在不增加推理成本的前提下提高多模态模型的决策质量。对于依赖复杂传感器阵列的工业系统,这意味着:

  • 降本:减少因模态冲突导致的误判与人工复核成本;
  • 增收:提升自动驾驶/安防产品的感知可靠性,加速商业落地;
  • 体验提升:在 AR/VR 交互中融合多种视觉线索,使虚拟助手更准确理解物理环境。

相比传统做法将多源输入简单堆叠,MARS 的 GRPO/DAPO 增益分别达 3.2%/4.9%,这种精度提升可直接转化为产品核心指标的进步。

与现有产品/工作流的接口

MARS 作为即插即用的RLVR 训练范式改进,可集成至现有视觉-语言模型(如 LLaVA、CogVLM)的强化学习微调流程中:

  1. 在数据准备阶段,需为每一模态单独计算单源奖励作为动态锚点;
  2. 在优势计算时,用 MARS 替换标准 GAE,引入信息增益调节项;
  3. 训练结束后,推理流程无需额外改动,模型已内化模态间自适应调控。

工程实现可基于 MARS 代码库 修改现有 RLHF/RLVR 管线,对现有推理引擎无侵入。

具体落地案例

  • 自动驾驶感知融合:某自动驾驶公司在利用多传感器(可见光+红外+激光雷达)进行夜间行人检测时,红外信号经常成为主导模态,但现有模型会因可见光噪声而错误地压制红外置信度。MARS 通过单源锚定奖励评估信息增益,训练出的策略在夜间场景下行人检测召回率提升显著,同时白天场景下不退化。
  • 智慧医疗影像决策支持:一套肺结节分析系统同时使用 CT 和 X 光影像。CT 信息密度高但辐射限制其使用频率,X 光更常用但细节不足。MARS 训练后的模型能在同时有 CT 和 X 光时充分利用 CT 的精细纹理,在仅有 X 光时也不被之前训练中的 CT 锚点误导,推理步骤更贴近放射科医生的多模态阅片习惯。

局限

  • - **单源锚点可靠性依赖**:MARS 将单源奖励作为动态锚点来量化信息增益,但未讨论单源奖励本身存在噪声或分布偏斜时的影响。若某模态的独立奖励估计不可靠,则优势归一化可能会错误地压制有效信号或放大干扰,从而损害多源融合的稳定性。
  • - **实验模态与任务覆盖有限**:实验仅覆盖红外和深度等少数视觉模态,且主要在 GRPO 与 DAPO 两种 RLVR 算法上验证。对于更多源(如 RGB + 红外 + 深度 + 文本)或更异构的输入、以及非 RLVR 范式下的泛化能力尚缺实证,限制了方法在通用多源推理场景中的推广。
  • - **计算效率未评估**:引入单锚点优势归一化需额外计算每个源独立奖励并动态调整优势项,可能增加训练时的计算与内存开销。论文未提供与基线方法的训练耗时或资源消耗对比,对实际落地中的效率影响不够透明。
论文Fanhu Zeng2026-05-25原文

相关内容