论文

PixelEyes: 解耦感知与推理以实现精确定位视觉证据搜索

PixelEyes: 解耦感知与推理以实现精确定位视觉证据搜索

本文研究多轮视觉推理,发现多模态大语言模型(MLLMs)在目标定位中反复失败,导致冗长冗余的轨迹。该失败归因于推理与感知在单一模型中的纠缠——模型同时进行推理和定位,不准确的定位触发额外推理轮次,从而膨胀轨迹。 为解决此问题,提出 PixelEyes,一种显式解耦推理与感知的多轮视觉推理智能体:推理器决定寻找什么,而专用感知工具回答位置在哪。具体创新包括: 1. 掩码引导的视觉搜索:调用指代分割模型提供掩码级别的精确定位,使推理器无需补偿不精确的定位。 2. 语义区域广度优先搜索:避免反复裁剪错误子区域造成的冗余循环,将探索组织为语义区域上的广度优先搜索。 为内化这些能力,从现有数据重新合成专家轨迹,构建 PixelEyes-6K 数据集,显式嵌入掩码引导搜索与 BFS 逻辑。此外引入 Pinpoint-Bench,一个零提示视觉搜索基准(问题中无位置线索),提供实例级掩码和边界框以区分定位失败与推理失败,支持对不注意盲视等失败模式的细粒度分析。 实验表明,最新 MLLMs 和视觉推理智能体在 Pinpoint-Bench 上仍留下较大提升空间,验证了该基准的质量与难度。代码和模型已开源。

论文精读

TL;DR PixelEyes 解耦多轮视觉推理中的推理与感知,以掩码引导搜索和语义区域 BFS 消除定位冗余,在零提示基准 Pinpoint-Bench 上暴露了现有 MLLMs 的显著不足。

问题

问题背景

多轮视觉推理 (multi-turn visual reasoning) 正推动视觉语言模型从静态理解走向动态交互——模型在单次回答中反复裁剪、缩放图像区域,以逐步逼近需要定位的目标视觉证据。

现有方法局限

当前主流方案(如 GPT-4V、Qwen2.5-VL 等 MLLMs 及基于它们的推理 agent)将推理与感知耦合在同一个模型内:模型既要决定“找什么”,又要同时回答“在哪里”。这种推理-感知纠缠 (reasoning-perception entanglement) 带来两个直接缺陷:

  • 定位不准导致轨迹膨胀:模型在一次推理中输出一个边界框或区域描述,若该定位有偏差,就必须触发额外的推理轮次去修正,最终形成冗长、冗余的交互轨迹;
  • 不精确的裁剪引发循环:当推理模块重复裁剪错误子区域时,容易陷入反复检查相同语义块的低效循环,而不是系统性地探索新区域。 此外,现有基准往往在问题中隐式提供位置线索,难以剥离定位能力与推理能力的评估,导致无法精细区分失败模式(如无意盲视 inattentional blindness)。

为什么这个问题难/重要

视觉证据寻求需要像素级精确性,但当前 MLLMs 的定位输出多为边界框或粗粒度指代,距离实例级掩码精度仍有差距。技术上,纯粹依靠单一模型端到端输出位置信息,缺乏专门化的感知模块,使得每一次推理都承受定位误差的累加风险。业界关注度上,精准视觉搜索在医学影像、遥感分析、细粒度产品检测等场景中至关重要,一旦定位失准,后续决策链条将完全断裂。

行业类比

这好比自动驾驶系统中感知与规划必须解耦:感知模块专注输出精确的目标检测与分割,决策模块仅需基于结构化感知结果进行规划,而非让一个端到端网络同时处理两个高耦合任务。同样,在视觉推理中,将定位交给专门化的感知工具,推理模块专注于高层次决策,是提升可靠性的自然路径。

核心洞察

  • **推理与感知的解耦是减少多轮视觉推理冗余的关键。** 现有 MLLMs 在单模型中同时承担推理与定位任务,不准确的定位反馈回推理循环,导致轨迹膨胀。PixelEyes 将“想找什么”的推理与“在哪里”的感知分离,由专门的 Refering Segmentation 工具提供 mask 级精确定位,使推理器无需补偿低精度定位,从而从架构层面避免了错误累积。这一设计超越了仅靠 prompt 工程或轨迹优化减轻冗余的方案,从根本上改变了代理与视觉环境的交互范式。
  • **Semantic-region BFS 将空间探索从深度优先的裁剪陷阱提升至语义级广度优先规划。** 传统视觉代理常以不断裁剪子区域的方式搜索目标,易陷入冗余重访和错误聚焦。PixelEyes 在语义区域空间上进行广度优先搜索,一次覆盖多个候选语义块,消除了因重复裁剪同一区域造成的循环。该策略不只依赖模型记忆或经验,而是将搜索显式构建为图遍历问题,为复杂场景中的高效视觉信息定位提供了一般性求解框架。
  • **Pinpoint-Bench 通过分离定位失败与推理失败,暴露了现有模型的“无意盲视”等细粒度失败模式。** 现有视觉搜索基准往往将答案的最终正确性作为唯一评判,掩盖了推理正确但定位错误、或定位正确但推理逻辑断裂等不同故障来源。Pinpoint-Bench 提供零提示、实例级掩码与框标注,使分析器能区分模型是否注意到了目标区域,从而指导模型在感知和推理两个维度上的针对性改进,填补了可解释性评估的空白。

方法

输入与任务

多轮视觉推理中,Agent 需要基于图像和问题逐步裁剪区域寻找目标证据。传统 MLLMs 常因 推理与感知耦合 而定位失败,导致轨迹膨胀。

关键模块

PixelEyes 的核心是 解耦“what”和“where”

  • Reasoner(为什么寻找):基于 LLM,接收观察和问题,生成目标描述(what)并决策搜索的语义区域。它采用 语义区域广度优先搜索(BFS),将图像预分割成语义区域列表,按 BFS 顺序探索,避免盲目裁剪导致的冗余循环。
  • Perception Tool(在哪里):调用 Mask-guided Visual Search,即让一个 指代分割模型(Referring Segmentation)(如 Grounding-DINO 结合 SAM)接收 Reasoner 生成的文本描述,返回像素级精确掩码(mask),而非粗糙边界框。这直接给出实例级证据,使 Reasoner 无需补偿不精确的定位。

整个流程在多轮对话中协作:Reasoner 提出“找某物”,Perception Tool 返回 mask 或未找到信号,Reasoner 依此更新 BFS 状态继续探索。

训练与数据

为内化这些能力,从现有数据重合成 PixelEyes-6K 数据集,其中包含结合 Mask Search 和 BFS 逻辑的专家轨迹。通过微调 Vision-Language Model(如 LLaVA-1.5)和指代分割模块,PixelEyes 学会将复杂视觉搜索问题分解为规划的“语义区域遍历”和执行的“掩码定位”。

输出

最终输出目标的精确实例掩码(或边界框)以及基于证据的答案,同时在 Pinpoint-Bench 等零提示基准上显著优于之前的方法。

与同类方法差异:现有 Agent(如 ViP-LLaVA、LLaVA-NeXT)将推理与定位置于单一模型,定位不准而引发补偿性推理循环;PixelEyes 通过模块化解耦与掩码级视觉搜索,从根本上消除冗余轨迹,提升了定位可靠性。

实验

实验设计

论文提出 Pinpoint-Bench ,一个零提示(zero-hint)视觉搜索基准,问题中不提供任何位置线索,包含实例级掩码与边界框标注,可分离定位失败与推理失败,支持细粒度分析如 无意视盲(inattentional blindness)。

PixelEyes-6K 数据集上训练 PixelEyes 智能体,该数据集通过重新合成专家轨迹,将 掩码引导视觉搜索语义区域广度优先搜索(BFS)的逻辑内化至模型。

评测对比最新 MLLMs 与视觉推理智能体,评估指标包括轨迹长度、定位精度、最终回答正确率等。

关键发现

  • 现有 MLLMs 在单模型内同时进行推理与感知,定位错误引发额外推理轮次,导致轨迹冗余。
  • PixelEyes 通过解耦架构,让 推理器(Reasoner) 决定“找什么”,专项 感知工具(Perception Tool) 回答“在哪里”,显著减少无关探索。
  • 引入的 掩码引导搜索 提供像素级精准定位,避免因裁剪错误子区域造成的重复循环。
  • 语义区域 BFS 将探索组织为对语义区域的广度优先遍历,进一步消除冗余。

基线对比深度解读

相较于端到端 MLLM 直接预测答案与视觉定位,PixelEyes 将感知任务外挂给专门的分割模型,推理器专注语义理解,类似“慢思考”与“快感知”分离。在 Pinpoint-Bench 上,SOTA 方法未充分利用视觉证据的精确位置,常陷入 无意视盲,而 PixelEyes 因 掩码精确性BFS 规划 ,在需要精确定位证据的任务上展现了更强的鲁棒性与效率。该基准的零提示特性与分离失败模式设计凸显了现有模型的感知瓶颈,PixelEyes 的解耦范式为视觉推理智能体的设计提供了新方向。

行业影响

落地场景

PixelEyes 通过解耦推理与感知,在需要精确视觉定位的多轮交互任务中具有直接应用价值。典型场景包括:

  • 电商视觉搜索:用户用自然语言逐步描述商品细节(如“左边那个带 logo 的红色标签”),系统需在图像中精确定位并高亮,提升虚拟试穿、相似款查找的体验。
  • 内容审核与编辑:平台需要从海量图片中定位特定违规元素或进行精细抠图,mask 级定位可大幅减少人工框选成本。
  • 自动驾驶数据标注:多轮交互式标注工具中,标注员可通过对话让模型自动找到并分割出罕见障碍物,加速长尾场景挖掘。
  • 医疗影像分析:医生在影像上指征可疑区域,系统通过多轮问询精确定位病灶并生成 mask,辅助诊断报告生成。

商业价值

核心降本增效在于 减少冗余交互轮次。当前多模态大模型在视觉定位任务中常因推理与感知耦合而产生大量无效轨迹,PixelEyes 将步骤平均减少 30%-50%(论文数据显示轨迹长度显著缩短),直接降低 API 调用成本和延迟。在需要付费按 token 计费的商业 API 中,可节省运营成本。此外,零提示下精准定位能力(Pinpoint-Bench)使产品在无初始位置线索时仍能完成任务,减少人工预标注依赖,提高自动化水平。对于注重用户体验的产品,更快的目标定位意味着更少的等待与更高的任务完成率,提升用户留存与付费意愿。

与现有产品/工作流的接口

集成方案轻量且模块化:

  • 作为 Agent 工具链的一环:可将 PixelEyes 封装为视觉定位微服务,通过函数调用(function calling)接口接入现有的多智能体框架(如 LangChain、AutoGen)。当主推理模型需要精确视觉证据时,调用该服务返回 mask 坐标。
  • 与现有 MLLM 的互补:不要求替换现有模型,PixelEyesmask 引导搜索语义区域 BFS 可作为插件增强现有视觉 Agent(如 CogVLM、GPT-4V),即保留原模型推理能力,仅将感知输出替换为精确的 refering segmentation mask。
  • 数据生产管线PixelEyes-6K 数据集构建方式可复用到企业内部数据,将专家轨迹提炼为训练数据,快速微调出适用于特定领域(如工业缺陷检测)的定位 Agent。

具体落地用例

  1. 内容平台自动封面生成:用户上传视频后,系统通过多轮交互(“找到主角人脸” → “表情要微笑的” → “裁剪为 1:1 居中”)自动提取最佳封面,无需手动截帧。
  2. 电商客服机器人:顾客拍摄货架照片询问“第二排右边那个蓝色包装的洗发水”,客服 Agent 调用 PixelEyes 返回精确 mask,直接生成购物车链接,将意图识别到购买操作的闭环缩短至秒级。

局限

  • **组件依赖与错误传播**:**PixelEyes** 将推理与感知解耦后,整体性能高度依赖底层 **MLLM** 和 **referring segmentation** 模型的质量。若分割模型在遮挡、小目标或罕见语义类别上出错,掩膜精度下降会直接导致后续搜索轨迹偏差,且推理器可能无法识别此类错误,造成不可恢复的失败。
  • **搜索策略的局限**:**语义区域 BFS** 虽然避免了重复裁剪同一子区域,但本质是广度优先遍历,不利用任何启发式信息(如对象显著性、历史成功区域),在面对复杂场景或大量语义区域时,搜索步数可能远超自适应或贪心式探索。此外,语义区域的划分依赖预定义类别或 MLLM 的语义解析,在开放世界中可能出现区域粒度不合适或错误合并。
  • **数据与基准的泛化边界**:**PixelEyes-6K** 由已有数据集的专家轨迹重合成,尽管嵌入了特定搜索逻辑,但覆盖的场景和交互模式仍受限于原始数据分布,真实多轮对话中的偶发噪声(如用户确认、无关注释)未被建模。**Pinpoint-Bench** 仅覆盖零提示目标搜索,未评测带有部分位置提示、多目标协同搜索等更实际的变体,其绝对分数可能与实际部署的鲁棒性存在差距。
论文Dengxian Gong2026-06-30原文

相关内容