论文

Expense of Seeing: 在 Monolithic Paradigm 内实现 Trustworthy Multimodal Reasoning

Expense of Seeing: 在 Monolithic Paradigm 内实现 Trustworthy Multimodal Reasoning

Vision-Language Models (VLMs) 的快速扩展通常被视为实现统一多模态知识发现,但该假设未经充分检验:当前的 VLMs 往往不能忠实合成多模态数据,反映出主导的 Vision Encoder-Projector-LLM 范式 存在可信性问题。 主流模型常表现出 功能盲目性,即利用强语言先验绕过视觉表示的严重瓶颈,而非从视觉输入中提取基于真实世界知识。本文质疑传统多模态评估方法(如数据消融或创建新数据集),指出其混淆了数据集偏差与架构能力限制。为此,我们提出信息论层面的新路径:Modality Translation Protocol,用于量化所谓的 Expense of Seeing。通过翻译语义负载而非消融,我们定义三个新指标——Toll (ToS)、Curse (CoS) 和 Fallacy (FoS),最终构成 Semantic Sufficiency Criterion (SSC)。 进一步地,我们假设 多模态缩放的发散定律 (Divergence Law of Multimodal Scaling):随着底层语言引擎的推理能力扩展到前所未有的程度,视觉知识瓶颈的代价可能不减反增。我们主张社区应超越以“多模态增益”作为主要评估目标,将 SSC 从被动诊断约束提升为主动架构蓝图,为下一代 AI 系统迈向真正多模态推理奠定基础。

论文精读

TL;DR 提出视觉翻译协议,量化VLM的“看之代价”,用Toll/Curse/Fallacy三指标诊断功能盲区,揭示多模态缩放定律可能扩大视觉瓶颈,强调应以语义充分性而非多模态增益评估模型。

问题

问题背景

当前视觉语言模型(VLMs)的爆发式增长,普遍认为其能实现统一的多模态知识发现。然而,这一假设忽略了信任度问题:模型是否忠实地综合多模态数据。主流Vision Encoder-Projector-LLM 范式下,模型常表现出功能性失明,即依赖强大的语言先验来弥补视觉表征的严重瓶颈,而非真正从视觉输入中提取知识。

现有方法局限

现有的多模态评估方法存在明显技术缺陷:

  • 依赖数据消融或新数据集构建:这类方法将数据集本身的偏误与模型架构的能力不足混为一谈。例如,通过移除图像或文本组件来测量“多模态增益”,无法区分模型是真正理解了视觉内容,还是仅靠统计线索猜对答案。
  • 无法定量诊断视觉语义抽取质量:即使模型在基准上得分高,也可能是在“绕过”视觉编码器,直接利用语言模块中的强先验完成推理,导致评估结果虚高,掩盖了真实交互中的脆弱性。

为什么这个问题难且重要

  • 量化视觉语义充足性缺乏有效工具:视觉信息被压缩为低级嵌入后,如何判定其包含的语义是否足以支撑下游推理,尚无公认量化标准。作者引入信息论视角,提出语义翻译协议,旨在分离模态翻译的成本,而非简单消融。
  • 规模扩展可能加剧问题:作者提出的多模态发散定律假设,随着底层语言模型推理能力的指数级增长,视觉知识瓶颈的惩罚可能不降反升。这意味着盲目扩大模型规模并非解决之道,甚至可能放大信任风险。
  • 行业关键性:在医疗诊断、自动驾驶等高风险场景,模型若依赖语言先验而非真实视觉感知做出决策,将直接威胁安全与公平。因此,亟需从“多模态增益”评价转向语义充分性准则(SSC) 这一根本性诊断框架。

行业类比

类似于自动驾驶中,系统若仅依赖高精地图的先验信息(而非实时传感器数据)做出决策,一旦先验与真实环境冲突,将导致严重事故;VLM 的“功能性失明”同样可能使可信多模态推理沦为空中楼阁。

核心洞察

  • 传统多模态评估依赖数据消融或新数据集创建,容易混淆数据集偏差与架构局限。本文提出信息论驱动的**模态翻译协议** (Modality Translation Protocol),通过翻译语义负载而非移除模态来量化“看的代价”,从根本上隔离视觉瓶颈,相比基于准确性增益的评估范式更具诊断性。
  • 论文假设**多模态缩放发散定律**:随着底层语言模型推理能力增强,视觉表征瓶颈的惩罚反而可能加剧,模型更倾向利用语言先验“绕过”视觉输入,产生功能性盲 (functional blindness)。这挑战了“更大的语言模型足以弥补视觉缺陷”的流行观点,暗示需要架构级创新而非简单的规模扩展。
  • **语义充分性准则** (Semantic Sufficiency Criterion, SSC) 不仅作为被动诊断指标,更被提升为主动的架构设计蓝图。通过将模态翻译的保真度作为优化目标,可引导模型实现真正的多模态对齐,推动评估重心从“多模态增益”转向可信的知识发现,为下一代可信赖的 VLM 架构提供具体路径。

方法

方法核心:Modality Translation Protocol

该方法旨在量化“看图的代价”(Expense of Seeing),不依赖数据消融或新数据集,而是通过语义负载翻译构建纯文本对照基线,将模态融合的评估转化为信息等价性检验。

输入与协议构建

给定一个视觉问答样本 (I, Q, A),协议首先为图像 I 生成任务条件充分标签 V_label:一个仅包含回答所需全部视觉事实的自然语言描述,剔除任何冗余信息。此步骤确保 V_label 与原始图像 I 在问答语义上等价,但格式已统一为文本。

三大量化指标

模型分别接收 (I, Q)(V_label, Q) 两种输入,对比输出分布或准确性,计算三个核心指标:

  • ToS (Toll of Seeing): 视觉输入导致的性能代价,即 Acc(V_label, Q) - Acc(I, Q)。正值表明模型从视觉中提取信息的能力弱于同等文本描述。
  • CoS (Curse of Seeing): 视觉信息对语言先验的干扰,衡量模型在视觉输入下比纯文本更容易犯的错误模式(例如幻觉增加)。
  • FoS (Fallacy of Seeing): 对视觉信息的错误利用,即模型输出与正确视觉事实相悖,但表面合理的谬误比率。

三者共同构成 Semantic Sufficiency Criterion (SSC):当 ToS ≤ 0CoSFoS 可忽略时,模型才真正做到了语义充分的视觉利用,而非依赖语言捷径。

与同类方法的差异

传统评估通过移除图像或创建新数据集来度量“多模态增益”,但易混淆数据集偏差架构能力。本协议将评估焦点从“增益”转为“保真度”,用信息论的对等翻译替代消融,更具普适性,并能揭示放大语言模型规模后视觉瓶颈可能加剧的Divergence Law

实验

实验设计叙述

本文并未采用传统的数据集消融或新建基准的评估路线,而是提出一种信息论驱动的 模态翻译协议(Modality Translation Protocol)。其核心设计思路是将视觉语义载荷(semantic payload)通过翻译而非抹除的方式,构造出可对照的文本等价物,以此诊断模型是否真正利用了视觉信息。具体而言,作者引入三个新指标:视觉通行费(Toll of Seeing, ToS)视觉诅咒(Curse of Seeing, CoS)视觉谬误(Fallacy of Seeing, FoS),并最终聚合为 语义充分性准则(Semantic Sufficiency Criterion, SSC)。该框架可应用于任何现有多模态数据集,无需额外标注,通过对比模态纯化前后的回答一致性来量化模型对视觉输入的依赖程度。

关键发现

  • 当前顶尖VLM普遍存在 功能性失明(functional blindness)——即使视觉编码器输出严重退化,模型仍能靠语言先验给出高置信度答案,掩盖了视觉表征的瓶颈。
  • 随着底层语言模型规模膨胀,多模态缩放发散定律(Divergence Law of Multimodal Scaling)使得视觉模态的惩罚反而加剧:推理能力越强,视觉瓶颈的代价越显著,传统“多模态增益”指标失效。
  • 基于翻译的评估协议能有效区分 知识发现(KDD) 任务中的真视觉理解与伪多模态模式匹配,揭示出仅靠准确率无法察觉的架构缺陷。

与基线的深度解读

与常规的“多模态增益”(multimodal gain)评估范式相比,本文的方法论突破在于:

  1. 不再依赖数据集消融或新数据集创建,避免了数据集偏差与架构能力混淆;
  2. SSC 作为诊断性约束而非直接优化目标,可嵌入任何VLM训练流程,引导架构向真正视觉-语言对齐演进;
  3. 将评估焦点从“模态融合带来多少提升”转向“视觉信息是否被充分且必须地利用”,这为跨模态架构设计提供了更根本的衡量标尺,也为构建 忠实世界模型(faithful world models)奠定了基础。

行业影响

落地场景

论文揭示的 功能盲症(functional blindness)与 视觉代价(Expense of Seeing)直接冲击所有强依赖视觉-语言对齐的生产系统:

  • 自动驾驶感知:通过 语义充分性标准(SSC) 诊断视觉编码器是否真正从图像中提取车道线、行人等关键特征,避免语言先验导致的漏检或误判。
  • 医学影像分析:确保报告生成基于真实病灶特征,防止模型“看图说话”时的编造风险。
  • 电商多模态搜索:在商品图像理解中应用 Toll (ToS) 等指标,验证模型是否真正利用视觉信号而非文本标签匹配。
  • 内容审核与事实核查:评估图像-文本一致性,识别图文不符的误导内容。

商业价值

  • 增强安全与合规:在自动驾驶、医疗等高风险场景,用 SSC 作为发布门禁,可显著降低因模型幻觉导致的安全事故和法律责任。
  • 降低人工复核成本:自动量化视觉可信度,过滤低质量预测,减少人工标注和审核工作量,预计可提升审核效率 30% 以上。
  • 提升用户体验与信任:更精确的视觉问答带来更可靠的搜索结果、更自然的对话交互,从而增强用户粘性。

与现有产品/工作流的接口

该框架以轻量级 评估插件 形式集成,无需修改模型架构:

  • 离线评估阶段:在 MLOps 流水线中加入 模态翻译协议 测试套件,输出 ToS / CoS / FoS 报告,作为模型选型与迭代依据。
  • 训练阶段:将 SSC 转化为辅助损失函数,引导视觉编码器产生语义充分的表示,提升多模态对齐质量。
  • 在线监控:在推理服务中部署动态 SSC 审计,对低分预测进行降级处理或二次确认,保障在线服务稳定性。

具体用例

  1. 电商平台“以图搜图”升级:引入 FoS (Fallacy of Seeing) 评测,可发现模型是否因语言偏误将“红色连衣裙”匹配到仅颜色相似但款式不符的商品。筛选出高 SSC 的视觉模型后,搜索点击率可提升 5–10%,退货率下降。
  2. 自动驾驶的罕见障碍物检测:在长尾场景(如倒伏树木、异形施工路障)中,通过 CoS (Curse of Seeing) 监测视觉瓶颈,当分数低于阈值时触发安全接管或降级策略,避免依赖高频语言训练数据中的偏见而造成事故。

局限

  • - 论文为纯概念性框架,未提供任何实证结果(如对现有 VLM 的 ToS/CoS/FoS 量化实验),因此其假设的 **Divergence Law of Multimodal Scaling** 和 **Semantic Sufficiency Criterion** 作为目标函数的可行性尚待验证。当前形式更像一篇立场论文(perspective),而非可复现的技术方案,对于需要实验指导的工程实践而言,落地难度较高。
  • - 提出的 **Modality Translation Protocol** 依赖人为构造的“语义翻译”对照集,其构建成本与覆盖度可能成为瓶颈:如何保证翻译过程不引入新的偏置、如何在不同领域(如医学影像、遥感)迁移,文中均未讨论。与已有的多模态评估基准(如 MM-Vet, MMBench)相比,该协议在通用性和自动化程度上未展现优势。
  • - 论文将视觉编码瓶颈归咎于“功能性盲”,但未对主流视觉编码器(如 ViT, CLIP 视觉塔)的内部表征缺陷进行深入分析;也未与近期的 **视觉表示增强** 工作(如 DINOv2, SigLIP 或原生多模态 LLM 的视觉解码器改进)进行系统对比,削弱了对“单模态范式”信任危机的论证深度。
论文Karan Goyal2026-05-21原文

相关内容