论文

展示而非讲述:在生成像素而非LLM文本中评估空间认知

展示而非讲述:在生成像素而非LLM文本中评估空间认知

空间智能对于智能体从静态语义理解转向与物理世界交互至关重要。许多空间任务基于连续视觉场景,其中位置、区域和路径更适合通过指认、标记或绘图来表达,而非精确坐标或离散文本符号。然而,现有空间推理基准通常要求坐标、选项或文本,导致图像生成模型存在答案接口不匹配的问题。这使得在相同任务语义下评估图像生成模型与文本输出VLM变得困难,尽管前者能直接在像素空间中外化空间判断。 我们提出ProVisE(Protocolized Visual Evaluation),一个基准无关的框架,通过协议约束视觉答案从图像生成模型中获取,并将其解析为与原始指标兼容的结构化预测。ProVisE还包含Agentic builder,用于为新基准构建并验证任务特定协议。我们进一步引入SpatialGen-Bench,一个 curated 诊断基准,包含470个样本,覆盖14个空间子任务、四个能力级别和多种答案形式。 我们在统一设置下评估了代表性的文本输出VLM和图像生成模型,并在六个外部空间基准上验证了Agentic协议构建。结果表明,当空间答案可直接在像素空间中外化时,图像生成模型具有竞争力,而文本输出VLM在组合空间推理中仍保持明显优势。这些发现揭示了像素空间表达与文本推理的互补优势,并为研究图像生成模型的空间认知建立了指标兼容的测试平台。

论文精读

TL;DR 提出 ProVisE 框架,将空间推理答案从文本转为像素级视觉标记,统一评估图像生成模型与文本 VLM,发现像素直接表达在空间任务中具竞争力且与文本推理互补。

问题

问题背景

空间智能是智能体从理解静态语义走向物理世界交互的关键能力。许多空间任务(如定位、路径规划)天然植根于连续视觉场景,最自然的表达方式是在像素空间中进行指向、标记或绘制,而非输出离散坐标或文本符号。然而,当前空间推理基准几乎都要求模型以坐标、选项或文本作答,这导致图像生成模型面临严重的答案接口不匹配

现有方法的局限

主流空间推理基准(如 VSR、What’s Up、SpatialVLM)均围绕**文本输出的视觉语言模型(VLM)**设计,迫使模型将空间关系转化为自然语言或数值坐标。但图像生成模型(如扩散模型、自回归生成器)具备直接在像素空间中表达空间判断的能力——例如画框、描边、标记区域——这种能力在现有评测中完全被浪费。其主要局限在于:

  • 接口单一:仅支持文本输出,无法接纳像素级答案,使得生成模型无法参与统一评测。
  • 语义割裂:将空间认知从视觉域强行映射到符号域,可能丢失精细的空间信息,且不符合真实场景中“看图指物”的交互范式。
  • 扩展性差:缺乏一种通用方法,能将任意空间任务的答案格式转化为可解析的视觉协议,并自动映射回原有评估指标。

为什么这个问题既困难又重要

该问题的核心挑战在于设计一种既保持任务语义、又能约束生成模型输出结构化的视觉协议。这需要同时解决:

  1. 协议化表达:定义像素空间中的合法答案格式(如特定颜色的框、线、蒙版),并保证生成结果可以被鲁棒解析。
  2. 自动化构建:针对不同基准,需要一种能够分析任务要求、自动生成并验证协议规则的智能构建器。
  3. 指标兼容:解析出的结构化预测必须无损地映射回原基准的评分函数,确保公平对比。

业界对具身智能和空间理解的需求持续攀升,在机器人操作、增强现实、自动驾驶等应用中,模型若能直接通过像素表达空间意图,将比文本输出更高效、更符合端到端学习范式。因此,建立一个能统一评测文本输出 VLM 与图像生成模型空间推理能力的测试床,对推动空间智能发展至关重要。

行业类比

就像自动驾驶感知中,模型直接在点云或图像上绘制 3D 检测框比输出坐标列表更贴近人类标注习惯和下游规划需求,本工作试图让图像生成模型用“画出来”的方式证明自己的空间理解,而非“说出来”。

核心洞察

  • 现有空间推理基准强制要求坐标、文本或选项输出,造成图像生成模型的答案接口错配。 ProVisE 通过协议化视觉答案,让模型直接在像素空间作答并解析为结构化预测,与原始指标兼容。 这一设计首次将文本输出 VLM 和图像生成模型置于同一任务语义下公平比较,消除了评估中的接口偏差。
  • 实验表明,图像生成模型在直接像素表达上具有竞争力,而文本输出 VLM 在组合空间推理中保持明显优势。 这种“展现”与“述说”的互补性揭示了多模态空间认知的不同路径,为构建融合两种表达形式的智能体提供了工程参考,提示应按照任务特性选择或混合这两种接口。
  • ProVisE 的 Agentic 协议构造器可自动为外部基准生成任务协议,并在六个空间基准上通过验证。 这意味着视觉评估框架能够泛化到新任务,显著降低手工设计协议的成本,使得图像生成模型的空间认知能力可在更广泛的任务中被系统性地测量和比较。

方法

方法概述

ProVisE 的核心思路是将图像生成模型纳入空间推理评测,通过协议化视觉答案弥合生成像素与文本指标之间的鸿沟。流程遵循“输入 → 协议路由 → 视觉生成 → 解析 → 评测”的管线。

1. 输入与协议定义
  • 给定一个视觉场景和空间问题(如定位、区域描绘、路径绘制),首先确定视觉协议。协议是一组约束规则,规定模型必须在输出图像中以特定视觉编码表达答案,例如:用红点标记位置、用蓝色框圈选区域、绘制带箭头的移动轨迹。
  • 协议由Agentic Builder 自动构建和验证。该 Agentic 模块分析任务语义,从候选视觉表示(形状、颜色、标注样式)中合成协议,并通过自检确保其可被下游解析器可靠识别,降低人工设计成本。
2. 视觉生成与路由
  • 图像生成模型接收提示,该提示将原始问题与协议指令融合,要求模型输出一幅包含视觉答案的图像。
  • 对于多任务评测,框架内置路由机制,根据任务类型选择对应的协议,保证同一基准内多种应答形式(点、线、区域)的统一处理。
3. 解析与指标兼容
  • 生成的图像进入协议执行与解析模块,利用规则或轻量视觉模型提取像素级信息(如检测点坐标、区域轮廓、线段端点),并将其转换为结构化预测(如包围盒坐标、关键点列表)。
  • 解析结果被映射到原始评测指标的输入格式,从而实现与文本输出 VLM 的直接对比,无需改变既定基准的评分逻辑。
4. 与同类方法的差异

ProVisE 不同于现有工作仅让模型输出文本坐标或选项,它允许生成式模型直接“画”出空间判断,并通过协议化保证答案可解析,消除了图像生成模型在传统空间基准中的接口不匹配问题。

实验

实验设计

基于 ProVisE 框架构建 SpatialGen-Bench,包含 470 个样本,覆盖 14 个空间子任务和四个能力层级,答案形式涵盖点、框、路径等。统一评估了代表性文本输出 VLM 与图像生成模型,并通过六项外部空间基准验证 Agentic protocol 的跨基准泛化能力。

关键发现

  • 图像生成模型在可直接于像素空间表达空间判断的任务上具有竞争力,例如标注位置或区域,避免了解析坐标的中间误差。
  • 文本输出 VLM 在组合空间推理(如相对位置描述与逻辑推断)中保持明显优势,表明符号化、链式推理对复杂空间关系建模仍不可或缺。
  • 两种模型在空间认知上展现出互补性:像素生成擅长细粒度定位与标注,文本推理擅长结构化关系整合。

与基线对比的解读

传统空间基准强制输出坐标、选项或文本,造成界面不匹配:图像生成模型的空间表达能力被低估。ProVisE 通过协议化视觉答案,让图像生成模型直接用像素回应,解析后与原始指标对齐。结果显示,消除界面偏差后,图像生成模型在多个定位任务中达到甚至超过文本 VLM 的精度。但涉及多步推理的任务仍以文本 VLM 为优,说明像素空间表达文本符号推理各自擅长不同类别的空间认知,融合二者可能是未来方向。

行业影响

落地场景

ProVisE 框架与 SpatialGen-Bench 基准为图像生成模型在空间推理任务上的评估提供了标准化接口,可直接用于自动驾驶场景中的环视感知验证、电商视觉搜索中的物体定位、以及医疗影像中的病变区域勾画。通过将模型输出统一为可解析的视觉标记(如点、框、路径),图像生成模型得以直接参与传统需坐标或文本回答的空间评测,避免文本输出模型的语义瓶颈。

商业价值

该方案降低了对文本输出 VLM 的依赖,使图像生成模型在空间表达类任务上展现竞争力,有望减少因坐标误差导致的标注返工成本(如自动驾驶数据标注)或提升交互式视觉产品的用户体验(如设计辅助工具直接生成指向性标注)。此外,Agentic builder 可自动化构建新任务协议,加速模型迭代与基准扩展,降低人工设计协议的人力开支。

与现有产品/工作流的接口

ProVisE 不绑定特定基准或模型,通过协议约束输出后解析为结构化预测,可无缝嵌入现有评测流水线(如使用 Hugging Face 数据集加载 SpatialGen-Bench,调用模型生成图像后经 parser 转换为标准指标)。与主流 VLM 工具链(如 LLaVA、GPT-4V)相比,该框架补充了像素空间表达的评测能力,可作为现有文本评测的并行组件,或集成进 A/B 测试平台以对比不同模态模型的优劣。

具体落地用例

  • 自动驾驶感知验证:系统输入前视图像并询问“前方 50 米内可行驶区域”,模型直接输出蒙版或多边形,ProVisE 解析后与真值计算 IoU,取代人工逐帧标注或脆弱的坐标回归后处理。
  • 电商图像检索:用户在商品图中圈选感兴趣区域(如“类似花纹的杯子”),后端使用图像生成模型在原图上生成注意力热区或裁剪框,ProVisE 协议确保模型返回可解析的表达,直接驱动搜索推荐,减少文本描述误差,提升点击转化。

局限

  • **视觉协议对组合空间推理支持有限,解析精度受生成质量制约。** 论文指出,图像生成模型在需要复杂组合推理的空间任务上仍弱于文本输出 VLMs,且当视觉标记(如点、框)位于密集区域时,解析器的规则匹配容易出错,导致评估偏移。此外,SpatialGen-Bench 仅包含 470 个样本,虽然经过精心筛选,但可能不足以覆盖多样化的真实场景,尤其是动态环境或 3D 空间理解任务尚不支持。
  • **预定义视觉协议限制了模型的表达自由度,且跨基准泛化依赖 Agentic 构建的人工校验。** ProVisE 要求模型必须按照指定协议(如特定颜色、形状的标记)作答,这虽保证了可解析性,但也压缩了模型自身更自然或更准确表达空间关系的可能性。同时,虽然 Agentic builder 能自动生成协议,但实验显示仍需人工复核以确保协议语义正确,这一过程可能成本较高,阻碍大规模自动化评估。
  • **评估流程增加了图像生成与解析的中间环节,较传统文本/坐标输出在效率与可控性上存在劣势。** 传统空间推理基准直接比对坐标或文本答案,而 ProVisE 需要调用图像生成模型产生像素级输出,再通过解析器还原为结构化预测,推理成本更高,且对生成模型的指令跟随能力(如能否精确绘制指定颜色、形状)有强假设,部分开源小型图像生成模型可能无法满足协议要求,导致评估失效。
论文Xu Wang2026-07-23原文

相关内容