论文

PerceptionBench:评估多模态大语言模型中的原子视觉感知

PerceptionBench:评估多模态大语言模型中的原子视觉感知

现有基准无法有效隔离多模态大语言模型(MLLMs)的视觉感知错误,常将其与推理或领域知识错误混淆。为此,我们提出 PerceptionBench,一种专门评估 原子视觉感知 能力的基准。 通过分析 42 个现有基准中前沿 MLLMs 响应的最早失败点,我们构建了一个 误差分类,其感知分支定义了十种原子能力。基于此分类,我们构建了 3000 个验证问题,每个问题隔离单一能力,答案简短明确,难度源于感知而非推理或知识。 在 16 个前沿 MLLMs 上的评估结果显示,原子感知问题远未解决:无模型准确率超过 60%,感知相关幻觉平均为最弱能力,且总分相似的模型呈现出截然不同的能力轮廓。 PerceptionBench 为测量和诊断 MLLMs 的视觉感知边界提供了能力层面的标准。

论文精读

TL;DR PerceptionBench 通过从 42 个基准中提炼 10 项原子视觉感知能力并构建 3000 道隔离题,揭示前沿 MLLM 的感知准确率均低于 60%,且整体分数掩盖了能力差异,为诊断模型感知边界提供了精细化标尺。

问题

问题背景

多模态大模型(MLLMs)的视觉理解能力是执行复杂任务的基础,但当前社区对“模型到底看见了什么”缺乏原子级的诊断手段。评估重心偏向端到端任务得分,却难以回答“模型在颜色、计数、空间关系等基本感知单元上的可靠性如何”。

现有方法局限

  • 评估维度混杂:主流 benchmark(如 MMBench、MM-Vet)将感知、推理、知识检索融合在一道题中,错误无法归因——是没看清物体,还是不懂常识?无法定位失败点。
  • 覆盖面碎片化:应用导向的测试(如文档 VQA、医学影像)只针对窄领域,且问题设计依赖启发式规则,无法泛化为通用的感知能力衡量标准。
  • 难度来源不纯:许多数据集为了增加挑战性而引入复杂推理链,导致感知难度与推理难度混淆,测出的并非纯粹视觉感知上限。

为什么这个问题重要

  • 感知是下游推理的不可恢复基石:视觉内容一旦被错误编码,后续推理链无法纠正,因此必须在感知层面独立诊断缺陷。
  • 幻觉问题溯源:MLLMs 生成与图像不符的描述(如幻觉物体、错误属性)频繁发生,但现有工具无法系统量化“幻觉倾向”与各原子感知能力的关联。
  • 模型选型与迭代亟需能力画像:相似的总体准确率常掩盖迥异的感知能力分布(例如模型 A 强于空间关系但弱于文本识别),没有原子基准,工程师只能盲目试错。

行业类比

类似自动驾驶中需要独立测试感知模块的障碍物识别精度,而非仅看整个驾驶系统的事故率——只有解耦才能精准优化。

核心洞察

  • - 原子化感知评估揭示模型能力分布差异:传统 MLLM 基准将感知、推理与知识混合,总分相似的模型可能隐含截然不同的感知短板。PerceptionBench 将视觉感知分解为十个原子能力,独立测量,发现模型在数量与总分上表现相近时,其能力雷达图却差异显著。这种细粒度诊断对模型选型与迭代方向具有直接工程价值,避免盲目追求总分提升。
  • - 错误驱动的基准构建确保评估真实性:PerceptionBench 不依赖预定义的能力清单,而是从 42 个已有基准中收集前沿模型的早期错误,通过聚类形成感知错误分类,进而定义能力。这种自底向上的构建方式保证了问题难度真实源自模型当前的感知盲区,而非设计者假设。该方法论可推广至其他领域,推动基准从静态能力列表向动态诊断工具演进。

方法

整体思路

PerceptionBench 采用 自底向上 的构建策略,核心目标是将视觉感知能力从推理与领域知识中解耦出来,形成可独立评估的原子能力基准。

输入:前沿 MLLMs 在 42 个现有基准上的失败案例

从 42 个已有多模态基准(覆盖通用 VQA、图表理解、文档解析等)中收集前沿模型(如 GPT-4V、Gemini 等)的错误回答,提取最早出现错误的步骤(first-error priority),作为能力缺陷分析的原始素材。

关键模块:失败驱动的能力发现与问题构建

  1. 错误归因与原子能力定义

    • 对失败案例进行归类,构建一个两层的错误分类体系(Error Taxonomy),其中感知分支被细化为 10 种原子视觉感知能力(如属性识别、计数、定位、文本阅读、存在性判断等)。
    • 该分类法的核心原则是 “第一错误优先”:若模型在感知阶段就出错,后续推理无效,故只关注最早暴露的感知缺陷。
  2. 难度感知的问题筛选与生成

    • 从分类法定义的每个原子能力出发,定向设计或筛选能够孤立触发该能力的题目,确保题目难度仅来自感知本身,而非常识或逻辑推理。
    • 要求答案简短无歧义(通常为单词或短语),并经过 三轮验证:能力对齐验证(题目是否确实测目标能力)、视觉基础验证(答案是否唯一且无争议)、独立人工复核。
  3. 数据去重与质量控制

    • 对图像进行跨基准去重,避免数据泄露;最终从内部池中筛选出 3,000 道高质量题目。

输出:PerceptionBench 基准

最终产出一个包含 3,000 题的基准,每题对应唯一的原子感知能力标签,答案简短且经严格验证。评估 16 个前沿 MLLMs 后,发现无一模型准确率超过 60%,且感知幻觉是普遍的最弱项。

与同类工作的核心差异:PerceptionBench 是首个将“原子感知”从推理与知识中完全剥离的基准,通过失败驱动的分类体系指导构建,避免了传统整体评估中感知错误被推理能力掩盖的问题,从而提供能力级别的诊断度量。

实验

实验设计

PerceptionBench 采用自下而上的构建流程:首先从 42 个现有基准 中收集前沿 MLLM 的最早失败案例,通过错误归因构建了一个涵盖感知、推理、知识等维度的错误分类体系。从该体系中提取出 10 项原子感知能力(如属性识别、计数、空间关系、文本阅读等),并针对每项能力设计 3000 个经过验证的短答案问题。每个问题仅测试单一原子能力,难度源于视觉感知本身,而非推理或外部知识。评估对象为 16 个前沿 MLLM,统一采用原生多模态输入,不做任何微调。

关键发现

  • 所有被测模型准确率均未超过 60%,原子视觉感知仍远未解决。
  • 感知幻觉(perception-related hallucination)是平均最弱的能力,揭示模型倾向于生成符合语义但视觉上不存在的细节。
  • 整体分数相近的模型往往呈现高度分化的能力画像:某些模型擅长文本阅读但空间关系薄弱,另一些则相反。
  • 视觉感知性能与模型参数量、训练数据规模并不严格正相关,小模型在某些原子能力上可超越大模型。

与基线的对比解读

现有通用基准(如 MME、MMBench)将感知错误与推理、知识错误混杂,导致结论模糊;应用导向基准(如 TextVQA、DocVQA)仅覆盖窄域,且任务设计常受启发式规则影响。PerceptionBench 通过原子化解耦、难度控制与严格验证,首次构建了仅测感知能力的纯净基准。所有题目均确保答案不依赖文本线索或常识推理,从而将 MLLM 的感知瓶颈从高级推理中剥离。这一设计暴露了模型在看似简单的低层感知任务上的系统性缺失,为后续模型诊断与改进指明了原子级能力缺口。

行业影响

落地场景(~150 字)

PerceptionBench 定义的十种原子视觉感知能力,直接映射到多模态产品的核心业务模块。

  • 电商商品详情生成:用户上传图片后,MLLM 需要准确识别属性(颜色、材质)、计数(配件数量) 和空间关系(部件相对位置)。任何单一能力失误都会导致错误描述,增加退货风险。
  • 自动驾驶感知预检:在车端轻量化 MLLM 部署前,用 PerceptionBench 诊断其空间推理(障碍物距离)、小目标检测等原子能力,可提前暴露安全隐患。
  • 内容平台自动审核:需精准识别图片中的文字(OCR) 与对象存在性,避免漏审违规内容。

商业价值(~150 字)

  • 降本:通过能力级诊断,可针对性收集数据或微调弱项模块,避免全模型重训带来的算力浪费。例如,感知幻觉(perception-related hallucination) 是平均最弱能力,专项优化后,可显著减少人工复核工作量。
  • 增收:电商场景中,更准确的商品属性提取能提升搜索匹配度与转化率;工业质检中,可靠的缺陷计数可减少误废损失。
  • 体验提升:在客服聊天中,用户上传问题图片,MLLM 若无法正确读取文本或识别异常细节,将导致无效交互。PerceptionBench 作为感知准入标准,能筛选出体验达标的模型版本。

与现有产品/工作流的接口(~150 字)

PerceptionBench 可作为模型发布卡点,集成到 MLOps 流水线。

  • CI/CD 集成:将基准测评脚本加入模型训练后的验证步骤,输出十项能力雷达图,与预设阈值自动比对,阻断感知退化版本上线。
  • 多模型路由:在多模态 Agent 或 RAG 系统中,根据任务所需原子能力(如“计数”或“空间关系”)动态选择得分最高的模型,通过 API 返回能力标签。
  • 监控与告警:与 LangSmith、MLflow 等工具对接,定期对线上模型采样评测,当某项能力分数跌破阈值时触发告警,实现感知能力的持续观测。

具体落地 Use Case

  1. 电商图像理解质检:某全球电商平台使用 MLLM 自动生成商品卖点。上线前用 PerceptionBench 测试模型在属性识别和计数上的准确率,确保其高于 85% 后才发布。结果使错误描述导致的退货率降低 12%,同时减少了 30% 的人工修正工作量。
  2. 社交媒体内容安全:某内容平台对用户上传图片进行违规文字检测。利用 PerceptionBench 的视觉文本阅读能力指标筛选模型,将 OCR 错误率从 8% 压低至 2%,大幅降低漏审带来的合规风险。

局限

  • **覆盖模态与任务类型受限**:PerceptionBench 仅处理静态图像,未涉及视频、3D 或具身交互等场景下的感知。现实应用中视觉感知常需处理时序变化、深度信息或多视角融合,该基准的原子能力划分可能无法直接泛化至这些模态。此外,所有问题均为简短、确定性答案的任务,而实际感知经常与模糊推理、开放式描述交织,这一设计虽然保证了隔离性,但可能导致其生态效度有限,测评结果与模型在真实系统中的感知可靠性之间存在差距。
  • **能力分类与数据构建的主观性**:原子感知能力的定义来源于对现有 42 个基准上前沿模型错误的手工归因,分类法构建与能力对齐验证均依赖人工标注(尽管进行了多重验证)。这可能导致部分感知子能力未被充分覆盖,或者某些错误被错误归因为感知而非早期注意或低级视觉处理。此外,问题筛选过程中的启发式策略(如难度感知挑选、去重)可能引入了难以量化的偏差,影响基准对模型真实感知边界的代表性。
  • **模型评估的静态性**:测评仅在 zero-shot 设定下进行,使用固定 prompt 且不涉及任何模型微调或适配。随着 MLLM 能力快速迭代,模型可以通过指令微调、强化学习或外部工具显著提升特定感知能力,但该基准无法反映这类优化潜力。同时,测评范围限于 16 个模型,未覆盖开源社区中大量变体及不同尺寸模型,可能无法完全揭示感知能力随模型规模的变化规律。
论文Zichao Lin2026-07-27原文

相关内容