论文

Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation 提升全模态语言模型:带有视觉去偏评估的分阶段后训练

当前全模态基准(如 OmniBench)可能通过 视觉捷径 夸大模型性能,即仅凭视觉证据就能回答查询,而非真正融合音频-视觉-语言证据。本文研究两个问题:现有基准能否区分视觉捷径与真实多模态融合?在视觉去偏评估下,后训练如何影响模型表现? 我们审计了九个全模态基准,使用 visual-only probing 检测视觉可解查询,并将其移除。保留模糊过滤下仍可稳定的子集,构建 OmniClean 清洁评估视图(从 16968 条查询中保留 8551 条)。在此基础上,以 Qwen2.5-Omni-3B 为基础,提出 OmniBoost 三阶段后训练方案:1) 混合双模态 SFT(mixed bi-modal SFT);2) 混合模态 RLVR(mixed-modality RLVR);3) 自蒸馏数据 SFT(SFT on self-distilled data)。实验表明:- 双模态 SFT 带来有限且不均衡的提升;- RLVR 首次实现广泛改进;- 自蒸馏重塑基准表现。最终,3B 模型性能达到甚至略超 Qwen3-Omni-30B-A3B-Instruct,且无需更强全模态教师。 结论:通过控制视觉泄漏的评估(OmniClean),全模态进展更易解释;小模型可通过带自蒸馏全模态查询监督的分阶段后训练获益。项目页面:https://cheliu-computation.github.io/omni/

论文精读

TL;DR 审计 9 大全模态基准、剔除视觉捷径后构建 OmniClean 测评,在 3B 模型上通过分阶段后训练(混合 SFT + RLVR + 自蒸馏)使性能比肩甚至超越 30B 级模型。

问题

问题背景

全模态语言模型 (Omni-modal LMs) 的设计目标是联合理解音频、视觉与语言,但在当下基准评估中,模型性能提升往往被视觉捷径 (visual shortcuts) 所夸大。当单模态信息已足以回答问题,评测得分无法反映真实的跨模态整合能力,这一现象正成为阻碍全模态研究可复现演进的核心瓶颈。

现有方法局限

现有全模态基准存在两类关键技术缺陷:

  1. 视觉泄漏 (visual leakage) 未被系统审计:大量评测样本仅依赖视觉输入即可正确作答,例如视频问答中画面本身已包含答案,音频流未提供额外证据。模型无需融合音频-语言证据,仅靠强视觉编码器便能得分。
  2. 后训练策略缺乏对视觉偏见的控制:当前主流后训练范式 (如 SFT、RLVR) 的设计与评估均基于含有视觉泄漏的原始基准,导致以下问题:
    • 混合双模态 SFT 带来的增益分布不均且有限,无法判断提升来自跨模态对齐还是视觉捷径的强化;
    • RLVR 阶段若奖励模型未考虑视觉偏见,会进一步放大捷径行为;
    • 自蒸馏 (self-distillation) 数据若源自视觉泄漏环境,会固化而非消除偏见。

这些局限使研究者无法准确衡量模型是否真正学到了音画同步、跨事件推理等全模态能力。

为什么这个问题难且重要

技术挑战:构建视觉去偏评测集需精确界定“仅视觉可解”,涉及多维度消融:

  • 需对每个样本进行纯视觉探针 (visual-only probing),移除所有视觉可解子集,但保留完整子集以保证跨模型可比性;
  • 不同模态间的上下文依赖具有细粒度差异,过滤规则的设计直接影响评测的有效性与稳定性;
  • 视觉去偏后,单模态能力与全模态得分间的相关性会发生显著偏移,需要重新建立能力预测模型。

业界关注度:全模态模型正从实验室走向产品化,在视频理解、智能助理、多模态搜索等场景中,虚假的全模态能力会直接损害用户体验和系统可靠度。一套被社区广泛接受的去偏评测基准,将成为筛选可复现技术进展的标尺,推动该领域从“刷榜”转向真正的跨模态推理突破。

行业类比

类似问题在多模态 VQA 早期出现过:VQA v2 通过平衡数据集的答案分布,纠正了语言先验偏见;本工作相当于为全模态领域定制了一版“VQA v2 式”的去偏审计,让模型不能仅靠视觉“蒙对”答案。

核心洞察

  • 视觉快捷方式(visual shortcuts)系统性地虚高了全模态(omni-modal)基准的评测得分。**OmniClean** 通过视觉探针(visual-only probing)剔除仅凭视觉即可回答的查询,构建了一个视觉去偏的评测视图,以更纯粹地衡量音频-视觉-语言证据的整合能力。与过往仅按任务聚合的评测不同,该工作首次对九大基准的 16,968 条查询进行大规模审计,量化了视觉泄漏程度并公开清理数据集,使得模型对比不再被视觉捷径所误导,为全模态研究提供了更可信的测试床。对于工程实践而言,这意味着在模型选型与迭代中应优先关注去偏评测上的表现,避免在高视觉冗余任务上过度优化。
  • **OmniBoost** 的三阶段后训练策略——**混合双模态 SFT** → **混合模态 RLVR** → **自蒸馏 SFT**——展示了小模型在没有更强全模态教师下的高效提升路径。其中 RLVR 首次带来跨任务的广泛提升,而自蒸馏通过过滤合成查询(self-distillation with filtered synthetic queries)重塑了能力轮廓,最终使 3B 模型达到了 30B 模型的性能水平。区别于直接借助大模型蒸馏或对齐的常见做法,该工作证明小模型可依赖自身生成的高难度跨模态查询进行自监督训练,并借助过滤机制确保数据质量。这为资源受限场景下落地全模态模型提供了低成本、可复现的范式,也提示模型开发者应重视训练阶段的组合效应,而非仅依赖单一阶段的大量数据堆砌。

方法

视觉去偏评估构建 OmniClean

输入为 9 个全模态基准的 16,968 条查询。首先执行视觉仅探查:对每条查询仅提供图像,测试模型能否仅凭视觉回答。若高于阈值则标记为视觉可解,从评估集中移除;若过滤会导致子集不稳定则保留全部。最终得到 OmniClean,包含 8,551 条必须整合音频-视觉-语言证据才能回答的查询,消除视觉捷径对分数的影响。

OmniBoost 三阶段后训练

基础模型为 Qwen2.5-Omni-3B,训练数据通过以下流程构建:

  1. 混合双模态 SFT:使用平衡的 audio-image-text 配对数据进行监督微调,覆盖双模态组合(如视觉+语言、音频+语言),目的是让模型初步形成跨模态关联。此阶段仅带来有限且不均衡的提升。
  2. 混合模态 RLVR:引入可验证奖励引导的强化学习,在生成的回答上计算奖励(如格式正确性、内容一致性),通过策略优化实现全局改进。该阶段首次在所有基准上观察到广泛增益。
  3. 自蒸馏 SFT:从第二阶段模型自身采样合成查询,经多重过滤(如移除低质量、高困惑度样本)保留高质量数据,再用这些数据执行标准 SFT。这一阶段重塑了基准分布,使小模型能力与更大规模模型可比。

输出与差异

最终 3B 模型在 OmniClean 上的总分略超 Qwen3-Omni-30B-A3B-Instruct,且全程未使用更强的全模态教师模型。与同类工作的核心差异:通过视觉去偏评估剥离捷径,揭示了后训练各阶段的真实作用,并用自蒸馏合成查询替代外部教师,证明了小模型可通过结构化后训练与自身数据循环取得竞争力。

实验

实验设计叙述

  • 审计与清洗:对 9 个 omni 基准(16,968 个查询)进行 visual-only probing,去除仅凭视觉即可回答的样本,构建 OmniClean(保留 8,551 个查询),以削弱视觉捷径对评估的干扰。
  • 后训练流程:基于 Qwen2.5-Omni-3B,设计三阶段后训练:
    1. Mixed bi-modal SFT:混合音频、视觉等双模态指令微调,数据均衡但增益有限。
    2. Mixed-modality RLVR:采用多模态 RLVR(强化学习验证器奖励),首次带来全 benchmark 的广泛提升。
    3. Self-distillation SFT:利用模型自身生成合成查询进行蒸馏微调,重塑基准表现分布。

关键发现

  • 视觉捷径普遍存在:多个 omnimodal 基准易被视觉 shortcuts 影响,原得分高不代表真正的跨模态推理能力。
  • 逐步增益:平衡双模态 SFT 仅带来 token-level 的局部改进;RLVR 阶段 是关键转折点,在 OmniClean 上观察到所有任务方向的一致提升;自蒸馏 进一步改善整体性能,并改变各子基准的得分模式。
  • 小模型竞争力:仅 3B 参数的模型,经过三阶段训练后,总体性能 略优于 基于更强教师模型的 Qwen3-Omni-30B-A3B-Instruct,且未使用更强教师。

对比解读与工程启示

  • 相较于直接使用大教师模型,本文的自蒸馏方法展示了 小模型通过筛选自身生成数据 也能逼近甚至超越大模型蒸馏的效果,为低资源场景提供了新思路。
  • 实验强调了 评估基准的视觉去偏 对解读 omni 模型真实能力的重要性;若忽视该步骤,可能高估模型进展,误导后训练方向。
  • 多阶段组合(SFT → RL → 自蒸馏)提示:不同阶段解决不同问题——SFT 注入基础能力,RL 提升判别与对齐,自蒸馏重塑数据分布,实际部署时可分层优化。

行业影响

落地场景

OmniClean 基准OmniBoost 训练方案 直接服务于需要可靠多模态理解的产品:

  • 智能客服 / 虚拟助手:用户同时出示图像并语音提问(如故障产品照片 + “这个零件怎么换?”),模型必须融合视觉、语音和文字证据回答,避免仅凭图像推测(视觉 shortcut)导致错误指导。
  • 内容审核与推荐:视频平台分析音视频与标题/评论的联合语义,防止仅靠封面图判断内容类别或违规风险,提升安全审核与兴趣匹配的精度。
  • 电商直播导购:买家语音询问商品细节,镜头对准商品;模型需结合语音意图、商品外观和文字描述给出答案,而非仅凭图像分类乱答,减少退货率。
  • 教育解题助手:学生上传手写解题过程图片并语音提问,模型综合视觉公式、语音思路和文字元数据推理,避免视觉泄露导致错误提示。

商业价值

  • 降本OmniBoost 三阶段训练(混合 bi‑modal SFT → 混合模态 RLVR → 自蒸馏 SFT)使 3B 模型在不依赖更强教师的情况下达到 30B 模型水平,大幅降低推理服务 GPU 成本,适合边缘部署。
  • 增收:消除视觉捷径提升多模态回答准确率,减少客诉与退货,在电商导购、广告精准匹配等场景直接改善转化率。
  • 体验提升:用户感知系统真正「听懂+看懂」其多模态输入,信任感增强,可支撑更高价值的咨询与交易转化。

与现有产品 / 工作流的接口

环节 集成方式
评估监控 引入 OmniClean 作为离线回归测试集,定期检测生产模型是否退化至视觉泄漏,指导数据标注清洗与模型迭代。
训练管线 OmniBoost 可插入现有微调流程:先多模态混合 SFT,再使用 RLVR(如基于 rule‑based reward 的强化学习)对齐人类偏好,最后用自蒸馏合成数据提升泛化性;HuggingFace TRL / DeepSpeed 等框架可直接支持。
数据引擎 自蒸馏所需的多模态查询由 LLM/VLM 自动生成,可与现有数据飞轮结合,降低人工标注成本。

工业启示:小型 omni 模型通过分阶段训练与视觉去偏评估,可替代大模型承担多模态理解任务,显著降低边际成本,同时通过 OmniClean 保障可靠性。

局限

  • **视觉泄漏审计的局限性**:OmniClean 仅通过纯视觉探测移除视觉可解的查询,未系统审计纯音频或音频-视觉共现等其他跨模态捷径。这意味着剩余查询仍可能被模型通过音频单模态线索或音视频统计共现模式解答,未能完全排除所有模态捷径。在实际工程评估中,仅依赖视觉去偏可能高估模型的多模态整合能力,建议扩展审计维度以构建更全面的去偏基准。
  • **方法与模型规模的泛化性未验证**:OmniBoost 的三阶段后训练仅在 Qwen2.5-Omni-3B(3B 参数)上验证,未探索在不同模型规模、架构或预训练基础下的效果。小模型与中等或大模型在后训练阶段的增益模式可能不同,RLVR 与自蒸馏的贡献比例可能随模型能力变化。对于希望应用该方法的工程师,需谨慎评估其向更大模型迁移时的收益与计算成本,可能需要调整数据混合或训练步数。
  • **自蒸馏数据质量的依赖性**:自蒸馏阶段依赖模型自身生成的合成查询,尽管经过多轮过滤,数据质量仍受限于初始模型的能力与偏差。生成的监督信号可能放大模型已有缺陷或引入幻觉,尤其在复杂推理任务中。这一局限意味着若基础模型薄弱,自蒸馏可能无法带来显著提升甚至损害性能,实际部署中需结合外部高质量数据或教师模型进行校正。
论文Che Liu2026-05-13原文

相关内容