论文

LoMo: 局部模态替换以实现更深的视觉-语言融合

LoMo: 局部模态替换以实现更深的视觉-语言融合

视觉-语言模型(VLM) 在大规模图文训练推动下,在多种理解和推理任务上取得了显著进展。理想情况下,将文本问题替换为其渲染图像形式,模型性能应基本不受影响。然而在实际中,这种模态替换会导致性能严重下降。我们将这种“载体敏感性”问题归因于当前训练语料的内在偏差。在图像描述、VQA、OCR 以及网络来源的交错数据等主流数据集中,文本和图像通常被组织成不同且不对称的角色:文本作为语言查询,图像作为视觉参考。这种数据偏差导致 VLM 对不同模态的信息获取表现出不同偏好,从而无法在文本和视觉载体间对齐语义等价内容的表示,使得模型推理在模态替换下变得脆弱。 为解决这一问题,我们提出 局部模态替换(LoMo),一种轻量级、架构无关的数据策展范式,旨在为语义等价的文本和图像载体提供跨模态表示不变性的监督。LoMo 通过将单模态提示重构为无缝交错的多模态序列来实现。它动态选择目标文本片段并将其重新渲染为图像,从而在“文本-视觉-文本”载体间保持相同语义。在 13 个多样化多模态基准上的广泛实验表明,LoMo 显著提升了整体多模态推理能力,并实现了更深层的跨模态融合。具体而言,它在基础模型上带来了一致的提升:在 LLaVA-OneVision-1.5-8B 上比标准 SFT 高出 2.67 分,在 Qwen3.5-9B 上高出 2.82 分。

论文精读

TL;DR LoMo 通过将文本片段动态渲染为图像,构建跨模态不变性监督,有效矫正 VLM 的“载体敏感”偏置,显著提升多模态推理与融合深度。

问题

问题背景

视觉语言模型(VLMs)通过大规模图文训练在理解和推理任务上取得显著进展,但多模态融合跨模态一致性仍存在盲区。理想情况下,将文本问题渲染成图像后模型的性能应保持不变,然而实践中这种模态替换会导致性能急剧下降。

现有方法局限

主流 VLM 训练数据(如图像描述、VQA、OCR 和网页交错图文)中,文本与图像通常扮演固定且非对称的角色:文本充当语言查询,图像作为视觉参考。这种数据偏置使得模型对文本和视觉载体形成差异化信息获取偏好,无法在表示层面对齐语义等价但载体不同的内容。常规监督微调(SFT)依赖原生的图像-文本对,缺乏显式引导模型学习“同一语义跨模态不变性”的机制,导致推理脆弱,尤其在需要同时依赖视觉与语言线索的场景(如文档问答、图表推理)中,模型易受输入形式干扰。

为什么这个问题难且重要

该问题本质是多模态表示对齐的深层障碍:不同模态的编码器结构、标记化方式、特征分布均不同,仅通过简单联合训练难以消除模态特有的捷径特征。业界对跨模态鲁棒性关注度持续升高,因为实际部署中用户可能以截图、拍照或文本方式提交同一问题,模型若不能稳定处理载体变化,将严重影响可靠性。同时,该问题也制约了多模态 Chain-of-Thought、多模态智能体等进阶能力的发展——当推理路径中需要跨模态传递语义时,微弱的对齐会放大误差。

行业类比:这类似于语音助手需要同时支持语音和打字输入,但模型只在语音数据上训练出超高准确率,一旦切换到文字输入就失灵——“信号载体”的敏感性揭示了训练数据的分布失衡,而非模型本身的理解能力不足。

核心洞察

  • 训练数据中文本与图像的角色不对称是导致 VLM 模态敏感的深层原因,LoMo 不再从模型架构或训练目标入手,而是直接针对数据管策进行‘载体对齐’:通过将单模态文本提示中的片段替换为语义等价的渲染图像,构造出无缝交织的多模态序列,迫使模型学习同一语义在不同载体间的表示不变性。这与只做图文匹配(如 CLIP)或简单数据增强(如随机替换)的思路不同,它精确控制了替换的粒度和上下文连贯性,为跨模态融合提供了更精细的监督信号。
  • LoMo 是一种极轻量、架构无关的数据整理范式,意味着任何 VLM 无需改动模型结构或增加参数即可获得更深的跨模态融合能力。这为工程落地提供了高可迁移性——只需在 SFT 阶段用 LoMo 处理过的数据微调,就能在 13 个多模态基准上稳定提升 2.6 分以上,且能同时增强纯文本能力,避免了其他跨模态对齐方法经常出现的‘模态遗忘’问题。

方法

输入与问题定义

当前视觉-语言模型 (VLM) 在训练中因数据偏差产生 载体敏感 (carrier sensitivity):将文本问题渲染为图像后,模型性能大幅下降。原因在于预训练语料 (图像描述、VQA、OCR、交错数据) 中,文本始终扮演语言查询,图像扮演视觉参考,导致模型对信息获取形成了模态偏好,无法在语义等价内容上建立跨模态表示不变性。

关键模块:局部模态替换 (LoMo)

LoMo 是一种数据整理范式,无需修改模型架构或训练目标,仅通过改造训练数据实现跨模态对齐监督。

  1. 输入:原始的单模态提示 (如纯文本问题),或已有的多模态序列。
  2. 动态片段选择与渲染:在提示中选定目标文本 span (如问题关键词、实体),通过文本渲染引擎将其转换成图像 (渲染后保留原语义)。该过程是局部且动态的,不预先固定替换位置。
  3. 多模态重组:将渲染图像插入原文本 span 位置,形成 文本-图像-文本 的无缝交错序列。例如,将 “What color is the car?” 中的 “car” 渲染为图片,得到 “[文本] What color is the [图像] car [文本] ?”,模型必须从视觉和文本载体中提取相同语义信息,从而隐式学习跨模态表示不变性
  4. 输出:增强后的交错序列被直接用于监督微调 (SFT),与标准 SFT 流程完全兼容。

训练与监督方式

LoMo 本身不引入额外损失函数或辅助任务,而是通过数据构造迫使模型在训练中自发解读渲染图像中的文本内容,并与原始文本查询建立一致性。这种 隐式对齐 避免了对齐模块、对比损失等复杂设计,继承基础模型的损失函数 (如语言建模损失)。

与同类方法的差异

相比传统多模态数据增强 (如图像-文本配对、随机打乱),LoMo 主动破坏文本与图像的固定角色边界,在局部尺度上制造语义等价但模态不同的载体变体,直接攻破载体敏感问题,而非简单增加数据多样性。

实验

实验设计

论文基于 LLaVA-OneVision-1.5-8BQwen3.5-9B 两个基础 VLM 进行监督微调,对比标准 SFT 与融入 LoMo 策划数据的训练效果。LoMo 动态选择文本指令中的目标 span,将其渲染为图像,构建交错的多模态序列,以提供跨模态表示不变性监督。评估覆盖 13 个多模态基准(含图像理解、VQA、OCR 等),并采用标准文本提问与渲染图像提问两种协议,量化模态敏感性。

关键发现

  • 一致性提升:LoMo 在 LLaVA-OneVision-1.5-8B 上较标准 SFT 平均提升 2.67 点,在 Qwen3.5-9B 上提升 2.82 点,跨架构增益稳健。
  • 载体敏感性缓解:渲染评估下性能退化大幅减少,表明模型对语义等价文本与视觉载体的表示对齐增强。
  • 深度融合迹象:消融实验显示,提升主因在显式对齐监督,而非简单数据扩充。

与基线对比的深度解读

标准 SFT 受训于非对称的文本–图像角色分配(文本为查询、图像为参考),导致模态信息获取偏好,当文本问题渲染为图像时性能骤降。LoMo 通过文本–图像–文本交错的序列设计,强制模型在相同语义但不同载体间建立不变表示,从而几乎无推理额外开销地强化了多模态推理鲁棒性。这一收益超越简单数据扩充或模型缩放,凸显出 数据编排策略 对深层融合的独立价值。

行业影响

落地场景

LoMo 所解决的“载体敏感”问题直接影响多模态产品的一致性。当用户以文本或图像输入等价问题时,模型应给出相同回答。落地场景包括:

  • 电商视觉搜索:用户打字或拍照提问,VLM 能稳定识别语义,避免推荐偏差。
  • 内容审核:新闻配文与截图需跨模态对齐,LoMo 可增强对篡改组合的识别。
  • 教育智能辅导:题目以印刷截图或文字输入,模型解析不受模态影响。
  • 文档智能:合同、发票中扫描件与文字混合,LoMo 提升信息抽取鲁棒性。

商业价值

  • 降低成本:LoMo 是数据策展范式,无需修改模型架构,直接融入现有 SFT 流程,减少为模态偏差单独设计修复策略的投入。
  • 提升转化与信任:在搜索、客服等场景,模态切换不降智能提升点击率与交易转化率,并降低因误判引发的风险。
  • 数据飞轮:LoMo 生成的交错图文数据更贴合现实分布,驱动模型持续进化,形成数据壁垒。

与现有工作流的接口

LoMo 架构无关,可插拔集成:

  1. 数据预处理:自动渲染文本段为图片,生成 (text, image, text) 交错序列,作为独立数据增强步骤。
  2. SFT 训练:将 LoMo 数据与标准对话数据混合,使用 LLaVA-Factory、DeepSpeed 等框架微调,只需约 5% 额外数据即可见效。
  3. 推理不变:模型部署后无需任何改动,直接受益于训练时注入的跨模态不变性。

具体落地用例

  • 电商多模态导购:用户用文字问“这条裙子的材质”或上传标签照片,LoMo 模型均能稳定回答,提升购买决策效率。
  • 医疗报告生成:输入混合有文字描述和影像标注的数据,LoMo 帮助对齐图像文字与报告文本,生成一致性更高的诊断摘要。

局限

  • LoMo 依赖将文本片段渲染为图像以构建跨模态监督,因此对渲染质量高度敏感。论文未充分探讨字体、字号、背景噪声、分辨率等渲染超参数对最终性能的影响,实际部署中若渲染图像可读性差,可能导致模型学到错误的跨模态对应关系,反而损害推理。此外,渲染步骤增加数据预处理成本,虽宣称轻量,但大规模应用时仍需权衡额外计算开销与收益。
  • 尽管 LoMo 在 LLaVA-OneVision-1.5-8B 和 Qwen3.5-9B 上取得了稳定提升,实验仅覆盖两类基础模型,缺乏对更多样化的 VLM 架构(如 InternVL、MiniCPM-V)或更大规模模型(如 34B/72B 级别)的验证。因此,方法的通用性尚未得到充分证明,在新模型范式下是否仍能保持相同增益需要进一步研究。
  • LoMo 通过局部模态替换强化了跨模态表示不变性,但可能忽略全局上下文一致性的建模。论文纯文本能力分析(附录 A)或表明,强制对齐文本与渲染图像可能会牺牲模型在文本-only 任务上的微调性能,这对需要同时处理纯文本与多模态输入的混合场景构成潜在风险。与显式对比学习或模态融合方法相比,LoMo 仅依赖数据变形,可能达不到更深层对齐的上限。
论文Feng Han2026-05-28原文

相关内容