论文

一项面向 Active Observers 的考试

一项面向 Active Observers 的考试

人类视觉是一个闭环:注视方向由中间假设持续引导,而非一次性快照。数十年的心理物理学和认知科学研究表明,这种主动观察对许多任务至关重要。当前多模态大语言模型(MLLMs)是否具备主动观察能力,是一个现有视觉语言基准未能回答的实证问题。 我们提出ActiveVision基准,用于量化评估 MLLMs 的主动观察能力。该基准包含 17 个任务,分为 3 个类别,旨在迫使模型进行反复视觉感知而非单次静态描述。 前沿 MLLMs 在 ActiveVision 上表现崩溃:我们评估的最高分模型 GPT-5.5(最高推理努力层级)仅解决 10.6% 的题目,在 17 个任务中有 11 个得零分;而 Claude Fable 5 尽管在多数推理和编程排行榜上名列前茅,仅解决 3.5%,远低于三位人类被试的平均水平(96.1%)。即使模型编写并运行自己的视觉代码,差距依然存在:这类代码在真实图像上不可靠,且捕捉其失败本身就需要模型所缺乏的主动感知能力。 综上,结果表明当前 MLLMs 缺乏鲁棒的主动视觉观察,这推动我们需要新的架构和训练目标来闭合感知-推理循环。

论文精读

TL;DR ActiveVision 基准首次量化评测 MLLM 的主动视觉观察,揭示所有前沿模型严重失败,最高仅 10.6% 正确率,远低于人类 96.1%,表明闭环视觉推理仍缺失。

问题

问题背景

多模态大模型(MLLMs)在静态图像理解上取得了显著进展,但几乎所有当前基准都假设视觉感知是单次前馈过程:给模型一张图,要求直接输出描述或答案。然而,人类视觉是主动观察的闭环系统,视线不断由中间假设驱动并动态调整,这种能力对于复杂视觉任务至关重要。现有基准并没有测量模型是否具备这类主动感知能力。

现有方法局限

当前的视觉语言基准(如 VQA、image captioning)仅要求模型给出一次性回答,无法考察模型是否会根据初步观察产生假设、并迭代地重定向注意力以验证或修正假设。这导致两个具体技术局限:

  • 评估维度单一:只衡量结果准确性,不衡量感知过程的策略,对模型是否“看对了地方”或“是否需要再看一眼”毫无约束。
  • 工具替代的陷阱:部分工作尝试让模型编写并执行视觉代码(如裁剪、计数)来弥补静态观察,但实验表明,模型生成的代码在真实图像上极易失败,且模型自身缺乏识别失败所需的主动感知能力,导致“用代码补观察”的方案在根本缺陷上形成死循环。

为什么这个问题难且重要

  • 技术挑战:主动观察要求模型具备感知-推理闭环,即模型需要:1) 从部分观测中生成假设;2) 规划下一个注视位置;3) 整合多步观测证据;4) 决定何时停止观察并输出答案。这远超前馈模型的设计范式,涉及强化学习、记忆、注意力的动态调度。
  • 业界关注度:从具身智能到自动驾驶,真实场景中模型不能依赖单帧输入,必须建立持续的、基于目标的视觉采集策略。如果基础 MLLM 缺乏主动观察原语,上层应用将很难做到鲁棒。论文结果显示,即使是 GPT-5.5 和 Claude Fable 5 这样的前沿模型,在 ActiveVision 基准上得分仅 10.6% 和 3.5%,而人类平均 96.1%,差距巨大,表明这是当下的关键短板。

行业类比

好比工业质检系统不能仅凭一张随机快照判定产品好坏,而需动态控制相机、多次对焦、推理缺陷模式,形成“看→假想→再看”的闭合环路,否则漏检率会居高不下。

核心洞察

  • **主动观察是当前 MLLM 的盲区**:人类视觉是闭环的,注视点由中间假设不断重定向,而 MLLMs 通常只在单次快照上操作,缺乏迭代的、假设驱动的感知循环。ActiveVision 基准通过 17 个任务强制重复视觉感知,发现即使最强的 GPT-5.5 也只能解决 10.6% 的题目,在 11/17 任务上得分为零,而人类平均 96.1%。这与模型在静态 VQA 上的高表现形成尖锐对比,暴露出架构层面缺失闭环感知机制的本质缺陷。
  • **工具使用无法填补主动感知的鸿沟**:让模型编写并运行视觉代码(如 OpenCV)只能部分缓解,在真实图像上代码不可靠,且模型难以自动发现和修正代码的错误——因为错误检测本身就需要主动观察能力。这揭示当前 Agent 范式在真实视觉交互场景下的根本局限:工具链不能替代端到端的感知-推理闭环,未来需设计原生支持迭代注视和验证的架构与训练目标。

方法

ActiveVision 基准的设计遵循 认知先导 → 迭代感知 → 域迁移 的构建流水线,目标是迫使多模态大模型(MLLM)进行多次、假设驱动的视觉观察,而非仅依赖单张图像的静态描述。

输入与任务类别

从认知科学中提炼出三类基础任务家族:

  • 视觉搜索:要求在复杂场景中定位特定目标或计数(如图1左的草地孤立区域计数);
  • 空间推理:追踪路径或推断遮挡关系(如图1中的绳索交叉点顺序读取);
  • 精细感知:匹配细微纹理或形状(如图1右的织物补片形状配对)。 每个任务都经过心理学验证,确保人类需通过多次扫视与假设验证才能完成。

关键设计原则:强制迭代感知

  • 单回合指令:模型在一次回答中必须给出最终答案,但题目本身天然排斥一次性整体理解;
  • 反静态描述:任务表述避免直接要求描述图像内容,而是要求提取必须经过预测→注视→返回循环的推理结果;
  • 合成骨架→真实图像:先在程序化生成的合成图像(如几何图案、迷生成像)上设计任务原型,确保任务结构可控且无歧义;再将相同任务结构迁移到真实世界照片(航拍图、织物特写等),形成17个任务的两个域版本。

输出与评估

模型输出为结构化答案(如数字、序列、坐标),使用Exact Match严格评分。基线模型包括GPT-5.5、Claude Fable 5等最新前沿MLLM。额外设计工具替代探针实验:允许模型自行编写并执行视觉代码(如OpenCV调用),但代码在不完美的真实图像上常产生幻觉错误,而排查错误本身又需要主动感知——暴露出模型缺乏闭环验证能力的短板。

与同类基准的差异

传统视觉问答基准(如MMMU、MMBench)默认图像可被一次性“读”完,而ActiveVision首次将感知-推理闭环作为评测对象,揭示了当前MLLM在主动视觉观察上的本质性缺失。

实验

实验设计

评估基于 ActiveVision 基准,该基准包含三大类共 17 个需要迭代视觉检查的任务(如数地块、追踪绳索、匹配纹理)。测试对象涵盖当前最强多模态大模型(GPT-5.5、Claude Fable 5 等),并与 3 名人类参与者的表现对比。额外设置工具使用实验,允许模型自行编写并执行视觉处理代码,以检验能否绕过感知缺陷。

关键发现

  • 所有模型均严重失败:GPT-5.5 在最高推理强度下仅解决 10.6% 样本,且在 11/17 任务上得分为零;Claude Fable 5 解决率仅 3.5%,而人类平均达 96.1%
  • 推理深度增益有限:增大 chain-of-thought 步数或推理预算无法显著提升表现。
  • 工具使用未能弥合差距:模型自行生成的视觉代码在真实图像上不可靠,且捕获代码错误本身又需要模型缺乏的主动感知能力

与基线对比的深度解读

人类近乎完美的结果反衬出当前 MLLM 视觉推理的致命缺陷:模型本质仍属单帧快照式处理,缺少认知科学中强调的注视重定向与中间假设验证闭环。即使拥有代码执行能力,也无法弥补对视觉细节反复核验的缺失。这直接冲击了单纯靠参数或推理规模 Scaling 就能解锁主动观察的假设,并指明未来方向——需研发具备主动感知机制的架构(如可微分注视、循环视觉编码器)及相配套的训练范式,方可能真正闭合感知-推理回路。

行业影响

落地场景

ActiveVision 揭示的 MLLM 主动视觉短板直接冲击当前依赖多模态模型的自动化质检、自动驾驶感知、医疗影像交互分析等场景。例如,电商平台用视觉模型实时审核商品图片的多角度一致性,或自动驾驶系统对复杂交通场景的动态理解,均要求模型像人类一样反复扫视、验证假设,而非一次性静态描述。若模型缺乏主动观察能力,这类产品将频繁出错,只能退化为简单筛选工具。

商业价值

该 benchmark 暴露的缺陷为可靠性升级开辟了明确路径:通过补充主动感知能力,可大幅降低误判率,从而减少人工复核成本(降本),并在安全攸关场景中规避高风险错误。对于企业级 AI API 提供商(如 GPT、Claude 的视觉入口),率先解决主动观察的厂商将获得差异化竞争力,打开高客单价的工业视觉、远程手术辅助等市场。此外,主动观察能力的改进可提升交互式 AI 助手的体验,使用户从“描述图片”转向“协作式检查”,延长使用时长与续费率。

与现有产品/工作流的集成

现有 MLLM 多以 单次前向推理 输出结果,而 ActiveVision 任务要求闭环感知—推理循环。集成策略可分为两步:

  1. 工具链扩展:允许模型在推理过程中调用视觉处理函数(如 zoom_image, extract_roi),并自主决定何时需要重新观察。这类似于当前 Agent 框架中“写代码—运行—反馈”的模式,但需增加视觉验证环节。
  2. 人机协同接口:在关键决策点插入人类注视热力图或手动标注点,作为主动感知的替代或补充,尤其适用于医疗影像会诊、保险定损等需要高置信度的环节。
具体落地用例
  • 电商商品合规检测:平台需审核数百万商品图片是否包含违规标识。传统模型对微小遮挡或变形识别差。集成主动观察能力后,模型可自动标记可疑区域,反复放大检查,将人工审核量减少 40% 以上,且避免大规模漏检造成的合规罚款。
  • 自动驾驶仿真测试:生成式世界模型渲染出复杂十字路口场景,要求模型在仿真中完成“找出所有潜在危险目标”等任务。若模型只在单帧置信度高时输出结果,可能漏掉被遮挡的行人。引入主动观察后,系统可规划连续注视点,强化对遮挡区域的记忆与推断,从而在仿真回归测试中更早暴露感知缺陷,降低路测成本。

局限

  • - **任务覆盖与泛化性有限**:ActiveVision 的 17 个任务主要围绕航拍区域计数、绳索追踪、织物斑块匹配等静态图像场景,可能无法全面代表认知科学中主动视觉的广度(如动态交互、立体感知、实时决策)。基准虽使用真实图像,但任务类型较为集中,模型在这些特定任务上的失败未必能直接推广至所有需要迭代感知的场景。此外,合成脚手架到真实图像的转换虽提升了视觉多样性,但任务设计仍以人为中心,未来需进一步拓展到自动驾驶、机器人操作等更复杂的视觉推理应用,以验证结论的普遍性。
  • - **人类基线样本不足**:实验仅邀请 3 名参与者测量人类表现(平均 96.1%),样本量过小且未报告人口统计学信息或个体差异,这导致人机对比的结论强度受限。参与者可能为熟悉任务的内部人员或领域专家,其高得分可能无法代表普通人类的平均水平,甚至存在天花板效应。若要确立“模型缺乏主动观察”这一论断,需要更大规模、更多样化的人类研究,并控制参与者对任务先验知识的差异。
  • - **模型评估范式可能未充分激发能力**:所有模型均以零样本方式评估,未进行足够的提示工程或多轮交互调试。主动观察本质上是一种行为过程,但当前评估只要求单次输出答案,可能低估了模型通过更长的推理链、中间输出或自适应提问所能表现出的潜力。工具使用部分仅测试了基础图像处理代码的编写与执行,并未探索更贴近主动视觉的迭代式工具调用(如多次截图、区域放大、逐步验证),这些都可能更有效地替代部分感知循环。
论文Jiarui Zhang2026-07-17原文

相关内容