论文

RoboSPA: VLA 模型能否超越简单场景与短时程任务?

RoboSPA: VLA 模型能否超越简单场景与短时程任务?

Vision-Language-Action(VLA)模型在语言条件下的机器人操控任务中已取得可观进展。然而,现有数据集与基准大多在预设设定下评估任务完成情况,难以揭示模型在空间与流程复杂度上升时的推理能力。为此,我们提出了 RoboSPA(Robot Spatial-Procedural Assessment),一个面向 VLA 模型具身推理诊断的大规模机器人操控数据集与基准。 RoboSPA 聚焦两个核心维度:细粒度空间推理 与 长时程流程规划,覆盖 10 个任务类别、56 个基础任务。每个任务实例化为五个难度等级,共生成 280 个变体,空间歧义性与流程复杂度逐级提升。我们跨多种本体与多样场景采集了 527K 条轨迹。 除二值成功率外,RoboSPA 还引入诊断性指标以支持更细粒度的评估。对代表性 VLA 模型的实验表明,当前系统在复杂空间关系、精细底层执行以及记忆密集型规划方面仍存在明显不足。 这些结果确立了 RoboSPA 作为一个具有挑战性的诊断基准,有助于推动更强大、可靠且可泛化的具身智能体的发展。数据与代码已开源:https://github.com/fanzhenxuan/RoboSPA。

论文精读

TL;DR RoboSPA 是一个大规模机器人操作基准,用 280 个渐进难度任务评估 VLA 模型的空间推理与长程规划,揭示现有模型在复杂场景下的明显短板。

问题

问题背景

VLA 模型在语言条件机器人操作任务上已能处理简单抓取、放置等短时动作,但评估通常局限于固定场景与预定义指令,无法反映真实环境中的空间歧义和程序复杂度。

现有方法局限

  • 评测维度单一:主流基准以整体成功率衡量,无法区分感知理解错误、动作规划失误或底层控制偏差。
  • 任务设计简化:物体摆放规则、遮挡较少、动作序列多在 5 步以内,模型仅需记住固定路径即可通过,未检验对空间关系的鲁棒推理。
  • 难度分级粗糙:缺乏系统性的难度提升框架,难以判断模型在哪一级别开始失效。
  • 数据覆盖不均:既有数据集常聚焦单一机械臂或少数物体类别,跨 embodiment 泛化证据不足。

为什么这个问题难且重要

空间推理要求模型从 RGB-D 中解析遮挡、相对位置与多物体布局,并映射到亚厘米级末端执行器控制;长时程规划则需要跨时间保持状态、重组子任务并在失败后恢复。二者叠加导致搜索空间呈指数增长,远超当前 VLA 的训练分布。对行业而言,没有细粒度诊断基准,就难以针对性改进模型架构、数据配比或训练策略,阻碍从实验室演示到真实部署的跨越。

行业类比

与大语言模型评测从单轮问答走向多步推理、工具调用等复杂基准类似,VLA 需要从“能否完成任务”转向“为何失败”的归因式评测,才能系统提升 embodied agent 的可靠性。

核心洞察

  • RoboSPA 将评估重心从“任务完成率”转向“空间-程序复杂度分解”,为诊断 VLA 模型的推理瓶颈提供了更细粒度的视角。与 CALVIN、RLBench 等主要关注单一场景零样本成功率的基准不同,RoboSPA 通过 5 级难度梯度和 280 个变体,将失败模式显式拆分为空间歧义、低层执行精度和长程记忆衰减等维度,帮助研究者定位具体弱点,而非仅得到一个聚合分数。
  • RoboSPA 的 527K 多 embodiment 轨迹与诊断指标设计,可直接用于 VLA 模型的数据增强与定向微调,指导提升泛化能力。现有 VLA 数据多局限于单臂或固定场景,而 RoboSPA 覆盖多机械臂和多样环境,配合空间关系准确率、步骤完成率等指标,可以判断模型在哪些任务类型或难度层级缺乏足够训练样本,从而进行针对性数据补充,避免无效扩展。

方法

方法概述

RoboSPA 的构建与评估遵循 任务生成 → 轨迹采集 → 指标诊断 的流程。输入为自然语言指令、RGB-D 观测与机器人状态,输出为模型生成的动作序列。核心不是提出新模型,而是设计一套递进式评测体系。

任务生成
  • 定义 10 类任务、56 个基础任务,覆盖 细粒度空间推理(如物体间相对方位、遮挡、多物体指代)与 长程程序规划(多步骤操作、子目标依赖)。
  • 每个基础任务实例化为 5 个难度等级,通过调整物体数量、场景杂波、指令模糊度与步骤数量,生成 280 个变体。例如低难度可能给定方位词“左边”,高难度需从多个候选物体中解析更复杂的空间描述。
轨迹采集

在多种 embodiments(如单臂、双臂、移动操作)和不同场景(桌面、厨房、仓储)中采集 527K 条专家轨迹。轨迹包含视觉观测、语言指令、本体感受与动作序列,用于后续模型测试,而非训练。

评估指标

除传统的 二进制成功率 外,引入多项诊断指标:

  • 空间推理正确率:统计模型是否按正确空间关系选择目标。
  • 子任务完成率 / 进步得分:长程任务中评估每一步是否完成,而非只看最终成功。
  • 执行精度:衡量抓取位置、放置误差等低级动作质量。

这些指标与难度分级对应,能定位模型不足:是空间理解错误、规划遗忘还是控制误差。

跟同类工作的差异点:RoboSPA 不依赖单一场景或固定评估协议,而是将空间模糊性与程序长度作为显式变量,系统解耦难度因素,提供比 binary success 更细粒度的诊断视图。

实验

实验设计

RoboSPA 基于 527K 条轨迹,覆盖 10 个任务类别、56 个基础任务,每个任务实例化到 5 个难度级别,共 280 个变体。评估在多种 embodiments 和场景下进行,除传统二值成功率外,引入诊断指标,从 细粒度空间推理 与 长程流程规划 两个维度分解失败原因。

关键发现

代表性 VLA 模型在简单场景下成功率尚可,但随任务空间模糊性和流程长度增加,性能显著下降。具体表现为:复杂空间关系下目标识别错误率上升;低层执行中抓取姿态或轨迹精度不足;长程任务中因上下文丢失导致步骤遗漏或顺序错乱。

与基线对比解读

相比只报告成功率的基准,RoboSPA 的诊断指标能区分“想错”与“做错”两类失败,帮助定位模型在感知、规划、执行哪个环节薄弱。渐进式难度设计避免了单一难度下性能饱和,暴露模型在复杂场景下的泛化短板,为后续 VLA 模型改进提供更明确的优化目标。

行业影响

落地场景

  • 仓储物流:电商订单拣选、货物分拣与打包,要求机械臂处理不同位姿、遮挡与多步骤流程。
  • 家庭服务机器人:整理房间、准备餐食等长程任务,需要空间推理与记忆规划。
  • 工业装配:精密部件组装、质量检测,对低层执行精度和程序化步骤容错要求高。

商业价值

  • 降本:通过诊断指标定位模型失败模式,减少物理试错和人工标注成本。
  • 增收:加速 VLA 模型迭代,提升机器人任务完成率,缩短产品上市周期。
  • 体验提升:更可靠的具身智能体在开放场景中减少人为干预,增强用户信任。

与现有产品 / 工作流的接口

  • 可集成到 MLOps 评测流水线 中,作为离线回归测试套件,对不同 VLA 模型版本进行自动化打分。
  • 与仿真平台(如 Isaac Sim、Mujoco)结合,在部署前验证模型的空间与长程规划能力。
  • 通过 success_rate、spatial_reasoning_score、planning_memory_score 等诊断指标,作为模型选型和超参调优的参考信号。

具体 use case

  • 电商仓储分拣:使用 RoboSPA 中 Fine-Grained Spatial Reasoning 任务组测试模型对物体姿态、堆叠关系的理解,再结合 Long-Horizon Procedural Planning 任务验证多步骤打包流程。例如,模型需先从杂乱料箱中识别目标物体,规划抓取顺序,再放置到指定区域。
  • 家庭服务机器人:在“清理桌面”场景中,RoboSPA 的渐进难度变体可评估模型对空间遮挡和步骤记忆的能力,帮助开发者定位失败点(如步骤遗漏或抓取点偏移)。

局限

  • - **仿真到真实迁移的局限**:RoboSPA 的数据主要来自模拟环境,虽然跨多个 embodiment,但真实世界的物理接触、传感器噪声和视觉域差异可能未被充分覆盖。论文未在真实机器人上验证 VLA 模型的迁移性能,因此其诊断结果可能无法直接预测真实部署中的失败模式,限制了该基准对实际机器人应用的指导价值。
  • - **诊断指标的粒度局限**:尽管引入了除成功率之外的诊断指标,但主要基于任务结果或高层行为分类,缺乏对模型内部推理过程(如中间状态预测、注意力可视化)的细粒度归因。因此难以区分失败是源于感知误差、动作执行不精确还是长期记忆衰减,这削弱了诊断的深度,后续工作可能需要更细粒度的可解释性工具。
  • - **与已有基准的覆盖差异**:与 RLBench、CALVIN 等基准相比,RoboSPA 增加了难度分级和空间/程序维度的系统变化,但任务类型依然以桌面操作、抓取放置为主,缺少接触丰富操作(如灵巧手内操作)、动态环境或人机协作任务。另外,基线的评估模型数量有限,只选择了少数代表性 VLA,可能无法反映最新的基于 LLM 的 VLA 或闭源模型的性能,导致结论的通用性有限。
论文Zhenxuan Fan2026-09-04原文

相关内容