ESI-Bench: 迈向具身空间智能,闭合感知-行动循环
空间智能通过感知-行动循环展开:智能体执行动作以获取观测,并推理观测如何随动作变化。不同于被动处理所见内容,智能体主动揭示不可见部分——遮挡结构、动态、包含关系及功能,这些无法仅通过被动感知解析。我们超越先前依赖神谕观测的空间智能框架,将观察者重塑为行动者。 我们提出ESI-BENCH,一个基于OmniGibson、根植于Spelke核心知识系统的全面具身空间智能基准,涵盖10个任务类别与29个子类别。智能体需决定启用哪些能力——感知、移动、操控——以及如何排序它们以主动积累任务相关证据。 对前沿多模态大语言模型(MLLM)的广泛实验表明,主动探索显著优于被动版本:智能体自发发现涌现空间策略而无需显式指令,而随机多视角常引入噪声而非信号,尽管消耗更多图像。大部分失败并非源于感知薄弱,而是行动失明:糟糕的行动选择导致劣质观测,进而引发级联错误。显式3D接地虽稳定了深度敏感任务的推理,但不完美的3D表示通过扭曲空间关系反而比2D基线更有害。 人类研究进一步揭示:与人类寻求证伪视角并在矛盾下修正信念不同,模型无论证据质量如何都过早高置信度承诺,暴露了元认知鸿沟——单靠更好的感知或更密集的具身交互无法弥合。
论文精读
TL;DR ESI-Bench 通过主动探索任务揭示,具身空间智能的瓶颈在于行动选择而非感知,模型缺乏人类般的元认知与探索策略。
问题
空间智能的主动探索鸿沟
空间智能的研究长期依赖 被动观测范式:模型从固定或随机视角的图像中推断三维结构、物理关系和物体属性。然而,这种范式隐含一个不合实际的假设——先知观察者(oracle observer),即智能体总能获得任务所需的完备观察。该假设在真实物理世界不成立,因为结构遮挡、动态变化、容器内部状态等关键信息必须通过策略性的 感知-行动循环(perception-action loop)主动获取。
现有基准(如ScanQA、MP3D)多将空间推理简化为单步问答:给定一个固定视图或随机多视图,要求模型回答距离、接触、尺寸等问题。这些设置剥离了“行动”在获取可靠观察中的作用,导致两个关键局限:(1) 无法评估信息获取策略本身——模型是否知道应当移动、抓取、改变视角以降低不确定性;(2) 引入冗余或误导信号——随机多视图被动合并反而增加噪声,干扰推理。实验表明,没有行动引导的被动观测甚至会降低性能。
这一问题之所以棘手,是因为它触及具身智能的核心:行动决定了观察的质量,观察质量又影响后续行动决策,形成级联错误。在真实场景中,智能体必须理解自身行动的感官后果,主动寻求能证伪当前信念的视角,而非在噪声中抓住一个高置信度但错误的答案。这使得空间智能的评价必须跳出纯感知能力的赛道,进入 行动选择(action selection)和 元认知(metacognition)的深水区——这正是具身空间智能(Embodied Spatial Intelligence)与经典计算机视觉的根本分野,也是机器人操作、自主导航等产业应用长期未能突破的瓶颈。
用一个具体类比:自动驾驶系统若只依赖车载周围摄像头全量采集的多视角图像,而不根据路况主动决定“何时需要绕开遮挡、靠近观察可疑物体”,就会像刚拿驾照的司机——看到很多画面却抓不住关键决策点,反而被无关信息淹没。ESI-Bench 正是将这一“看”与“动”的闭环搬进标准化评测,迫使模型学会像经验丰富的老司机一样,有目的地探索未知。
核心洞察
- **行动盲 (Action Blindness) 是具身空间智能的根本瓶颈,而非感知能力不足。** 以往基准大多假定智能体被动接收完美观察,但 ESI-Bench 让智能体主动选择动作以获取观测,揭示出性能卡点在于动作决策:糟糕的动作导致糟糕的观测,进而引发级联推理错误。即便将多视图图像批量喂入,随机观测也会引入噪声而无助于推理,而主动探索却能让模型自发涌现空间策略。这颠覆了“堆更强视觉模型就能解决空间推理”的常见假设。
- **显式 3D 表征是一把双刃剑。** 在需要深度敏感判断的任务上,3D 接地能稳定推理,但低质量或不完整的 3D 重建会严重扭曲空间关系,其危害甚至超过纯 2D 基线。这一发现挑战了“3D 信息总是有益”的直觉,指出当前 3D 感知模块的鲁棒性仍远未满足具身场景的需求,直接套用可能适得其反,需要更可靠的 3D 重建与对齐机制。
- **模型面临元认知鸿沟,单纯增强感知或交互无法弥合。** 人类遇到矛盾时会主动寻找证伪视角并修正信念,而模型即使证据质量很差,也会过早地高置信度做出决策,暴露出对自身不确定性缺乏评估的元认知缺陷。这指出未来突破不仅需要更强的感知和行动策略,还需为智能体注入信念更新与不确定性建模的内在机制,否则探索效率与可信度始终受限。
方法
ESI-Bench 构建在一个具身交互框架上,将空间智能评估从被动观察转向主动感知-动作闭环。基准建立在 OmniGibson 模拟器中,任务设计植根于 Spelke 的核心知识系统,覆盖 10 大类别和 29 个子类别。
任务构建流水线
- 任务提案:首先由大模型(如 GPT-4o)生成任务描述和初始配置,涵盖物理结构(如材料透明性、液体体积)、动态过程(斜面滑动、堆叠稳定性)、度量比较(空间距离、尺寸)、空间关系(接触、对齐)以及动作序列等维度。
- 场景实例化:根据提案在 OmniGibson 中自动布局对象,设定智能体的初始视角和可执行动作集(移动、导航、抓取、推拉等高层动作)。
- 轨迹收集与元数据:通过规则或启发式方法生成专家轨迹,保存为参考。同时元数据包括真实标签和任务难度标定。
- 人工验证与偏差审计:对生成的任务进行正确性、可回答性和非平凡性检验,并分析语言偏差和对象类别偏差,确保任务质量。
智能体交互
智能体收到任务后,通过行动选择提示自主决定下一步动作(移动、旋转视角、操作物体)。动作执行后获得新观测,形成多步交互循环。以此考察智能体是否能在有限的步数预算内,主动探索并收集关键证据,而非依赖一次性全景图像。
与同类方法差异
不同于仅提供固定视角或多视图的被动基准,ESI-Bench 强制模型在行动盲区中做出选择,真实反映具身场景下的空间推理困境,并首次系统量化了行动选择对性能的主导影响。
实验
实验设计
基于 OmniGibson 仿真器构建 ESI-Bench,覆盖 10 大类 29 子类具身空间推理任务。评估 SOTA MLLMs,对比三种输入模式:(1) 主动探索——Agent 自主选择感知、移动、操控等动作序列;(2) 被动多视角——固定多视角图像;(3) 3D 几何提示——附加显式深度或点云。同时开展人类受试研究,量化模型与人的认知差距。
关键发现
- 主动探索大幅优于被动多视角:模型自发涌现绕飞、拨动等空间策略,而随机多视角因引入噪声反而损害性能。
- 失败根源是“动作盲目”:劣质的动作选择导致劣质观察,引发级联错误,感知能力并非首要瓶颈。
- 3D 信息双刃剑:在深度敏感任务上,精确的 3D grounding 可稳定推理;但不完美的 3D 重建比 2D 基线更差,扭曲空间关系。
- 元认知鸿沟:模型过早高置信度提交答案,不像人类会主动寻求证伪视角并修正信念,即使增加交互轮次亦无法弥补。
与基线对比解读
被动多视角虽消耗更多图像,但缺乏主动试探过程,难以获取遮挡、动态、容纳等非直接观察信息。3D 基线在重建准确时可提升物理结构任务,但在液体体积、形变体等动态场景中因重建误差引入错误先验,导致推理崩塌。该对比表明:提升具身空间智能的核心在于优化动作选择与信息增益策略,而非单纯增强感知或堆砌多模态数据。人类实验进一步揭示,现有多模态模型缺乏证据质量自评能力,该缺陷无法通过更强的感知或更多交互单独解决,需从元认知架构层面突破。
行业影响
落地场景
具身智能 与 空间感知产品 是直接受益领域:
- 仓储与物流机器人:在遮挡严重的货架场景中,机器人需通过主动移动视角判断容器内容物、堆叠稳定性或形变物体状态,减少误抓和碰撞。
- 自动驾驶与服务机器人:在路口或动态人群中,需规划观测序列来消除盲区,提升对遮挡物(如车辆、行人)的运动预测能力。
- AR/VR 空间理解:设备可通过引导用户移动视角,更精确地重建3D场景、识别物理接触关系,增强虚拟物体与真实环境的交互可信度。
商业价值
- 降低运营成本:主动探索策略可大幅减少机器人因感知盲区导致的抓取失败、碰撞事故,直接降低维修与误工损失。
- 提升用户体验与安全性:在自动驾驶中,更鲁棒的空间推理能提前预判风险,避免因单帧误判造成的急刹或事故。
- 加速模型迭代:ESI-Bench 提供标准化评估,可量化模型在行动选择与感知联合上的短板,帮助团队聚焦“行动盲区”而非盲目堆叠感知模块,缩短开发周期。
与现有产品/工作流的接口
- 评估工具链:将 ESI-Bench 集成进 MLOps 流程,作为具身模型上线前的必测项,通过 OmniGibson 模拟器批量评估。
- 行动策略模块:现有视觉-语言模型(如 GPT-4V、LLaVA)可外挂主动探索头,由 ESI-Bench 提供奖励信号微调“何时移动、看向何处”的决策。
- 3D 感知模块:ESI-Bench 结论提示,不完美的 3D 重建反而有害,因此可在融合模块中增加置信度过滤,仅在高置信度时启用 3D 特征,避免破坏空间关系。
具体用例
- 仓储抓取:机器人面对半透明料箱时,需主动调整视角来确认内部物体数量与姿态,现有纯被动式系统常因单一视角误判而空抓;引入主动探索策略可降低误抓率,并减少人工复检。
- 自动驾驶泊车:车辆在窄位泊车时,需通过前进/后退的小幅移动来理解与邻车的空间关系,传统基于静态鸟瞰图的系统易受遮挡影响,而具身探索框架可动态规划观测路径,提升泊车成功率。
局限
- **模拟到现实的泛化差距**:基准完全基于 OmniGibson 模拟器构建,虽然该模拟器提供了高保真物理与可交互环境,但真实场景中的传感器噪声、非刚性物体变异、环境光照变化等复杂因素未能体现。论文未讨论 sim-to-real 迁移的可行性,模型在模拟中学到的探索策略可能无法直接转移到物理实体机器人上,限制了基准的最终实际影响力。
- **任务生成与数据集偏见风险**:所有任务由 GPT-4o 生成,虽然经过多轮人类验证和偏见审计,但生成的任务分布仍可能受限于语言模型的先验知识,难以覆盖开放世界中所有边缘案例。此外,物体类别、空间场景的多样性有限,可能无意中引入系统性偏好,使得模型在特定子任务上表现虚高,对更广泛的具身空间推理的泛化性仍有待外部验证。
- **评估范式的局限性**:实验仅对比了主动探索与被动多视图等设定下的现有多模态大语言模型(MLLMs),未引入强化学习、任务规划等具身智能中常用的闭环策略。人类研究仅有 50 名参与者,规模较小,可能不足以充分刻画人类空间推理的多样性与上限。此外,基准强调高层动作选择,不涉及底层运动控制,限制了对其在完整感知-执行闭环中表现的全面评估。