RobotWorld: 面向多样任务与具身形态的机器人使用多模态 Agent 基准测试
通用 Agent 已能编写代码、调用工具并完成复杂的数字任务,但这些能力能多大程度迁移到物理世界仍待探究。为此,我们提出 RobotWorld,一个用于机器人使用的挑战性仿真测试平台:通过机器人接口将指令与观测转化为物理任务执行。 该平台包含 84 个任务,覆盖操作、移动操作、运动、驾驶与空中控制,并设置了明确的交互预算与可执行的成功检查。通过结合任务结果与执行轨迹分析,我们识别出哪些能力可以迁移,以及哪些缺口阻碍了可靠完成。 进一步分析发现,当前 Agent 能够构建复杂的感知与控制流程,包括图像分割、相机标定、空间估计与基于动力学的计算。然而这些能力并不能稳定组合为成功行为: - Agent 虽到达指令位姿,却丢失了任务相关的物体状态; - 无法纠正无效动作,恢复过晚,或将未完成任务误判为已完成。 这种不均衡的迁移也因模型而异:Astra 在空间与受限接触目标上成功率更高,而 Opus 5.5 在连续平衡与限时交互目标上表现更好。RobotWorld 将结果与执行行为相联结,既提供了严格的验证场,也给出了剩余能力缺口的实证描述,为训练与设计更可靠的物理世界 Agent 确立了具体目标。
论文精读
TL;DR RobotWorld 基准用 84 个跨操作、移动、驾驶和空中控制的仿真任务,评估多模态智能体物理任务执行能力,发现其能构建复杂感知控制流程但难以可靠组合成成功行为。
问题
问题背景
通用 agent 在数字世界已经能够编写代码、调用工具和完成复杂任务,但将这些能力迁移到物理机器人控制,已成为 embodied AI 的核心问题。
现有方法局限
现有 embodied benchmarks 存在三个明显不足:
- 单一 embodiment 覆盖不足:大多数基准只针对固定机械臂或单一移动平台,缺乏跨操作、移动操作、腿足、地面车辆和空中飞行器的统一评测。
- 评估信号粗糙:只报告最终成功率,没有显式 interaction budget 或可执行的 success check,无法反映真实部署中的资源消耗、错误恢复和时序约束。
- 缺乏失败归因:很少提供 execution traces 的细粒度分析,难以区分是感知错误、控制失败还是决策失误,导致模型改进缺乏明确目标。
为什么这个问题难/重要
物理世界任务要求 agent 组合感知、闭环控制、空间推理和时序决策,状态连续、噪声大、错误代价高,且不同 embodiment 的动力学差异显著。数字 agent 的代码生成和视觉识别能力并不保证能可靠组合成物理行为,例如 agent 可能到达目标位姿却丢失了任务相关的物体状态,或者误把未完成任务当成完成。业界对 foundation models 用于机器人有很高期待,但缺少像 SWE-bench 之于软件工程那样的公认评测基准,能严格量化能力迁移和不一致。
行业类比
类似于 SWE-bench 用真实 GitHub issue 和测试用例评测代码 agent,RobotWorld 试图为机器人使用场景提供统一、可复现的测试床,让模型在带预算约束和成功检查的物理仿真中暴露能力差距。
核心洞察
- 机器人使用基准的核心挑战在于能力组合断裂,而非单点技能缺失。已有工作多独立评估感知、规划或控制模块,RobotWorld 通过 84 个端到端任务与执行轨迹分析发现,智能体能构建复杂工作流(如分割、标定、动力学计算),但这些模块无法稳定串联成可靠行为,常丢失中间状态或误判任务完成。这为评估多模态智能体提供了新的诊断维度,将注意力从单一能力指标转向模块协同的鲁棒性。
- 显式交互预算与可执行成功检查让基准从“能否完成”升级为“在限定资源下如何完成”。与只报告最终成功率的基准相比,RobotWorld 要求智能体在 token 与交互次数约束内操作,并记录执行轨迹、资源消耗与失败模式,从而揭示“低效成功”与“高效失败”的工程差异,更贴近真实部署中成本与延迟约束下的智能体行为。
- 模型能力在不同任务域呈非对称分布,提示物理世界智能需按场景细分训练,而非追求单一通用模型。Astra 在空间与约束接触目标上更优,Opus 5.5 在连续平衡与定时交互上更强,这要求从业者根据任务特性选择或微调模型,并针对模型短板设计针对性训练策略,其跨任务能力画像为后续模型改进提供了具体靶点。
方法
输入与任务定义
RobotWorld 将机器人使用任务形式化为:智能体接收自然语言指令 instruction 与逐步观察 observations,在显式交互预算内调用机器人接口执行动作。
关键模块
- 任务构造:84 个手工任务构成基准,横跨操作、移动操作、足式、驾驶、空中控制等 embodiment,每个任务定义可执行的成功检查与预算。
- 交互循环:智能体循环选择工具调用(如移动关节、抓取),环境执行并提供反馈,直到预算耗尽或产出最终判定。
- 观察与动作接口:提供 RGB 图像与本体感受向量;动作通过统一的机器人工具(
move_joint、gripper_close等)暴露。 - 执行记录:全程记录轨迹、动作开销与资源消耗,用于行为归因。
输出与评估
输出为二元成功标签和轨迹分析,揭示智能体是否将感知、规划、控制组合为连贯行为,而非孤立技能。
与固定策略或单一 embodiment 基准不同,RobotWorld 聚焦于机器人接口的开放式工具使用,通过预算约束和可执行成功检查提供严格的能力评估。
实验
实验设计
RobotWorld 基准包含 84 个任务,覆盖操作、移动操作、运动、驾驶和空中控制等域,每个任务设有明确的交互预算和可执行成功检查。实验在多个多模态 agent(如 Astra、Opus 5.5、Gemini、DeepSeek、Kimi)上进行,记录任务结果和执行轨迹,以分析能力转移和失败模式。
关键发现
当前 agent 能够构建复杂的感知与控制工作流,包括图像分割、相机校准、空间估计和基于动力学的计算。但这些能力不能稳定组合为成功行为:agent 到达指令位姿后却丢失任务相关物体状态,不纠正无效动作,恢复过晚,或将未完成任务误判为完成。模型差异明显:Astra 更擅长空间和受限接触目标,而 Opus 5.5 更擅长连续平衡和定时交互目标。
与基线对比解读
该研究没有单一固定基线,而是在多个先进多模态 agent 之间横向比较。结果表明能力转移不均:不同模型在不同子任务上各有优势,但均无法端到端可靠完成物理任务。这暴露了当前 agent 在状态追踪、错误恢复和完成判定上的系统性缺陷,为未来训练和设计更可靠的物理世界 agent 提供了具体目标。
行业影响
落地场景
RobotWorld 为具身智能与机器人系统提供统一仿真测试环境,适用于仓储物流、自动驾驶、无人机巡检、家庭服务机器人等产品的算法验证与迭代。企业可将其用于评测多模态智能体在操作、移动、驾驶、飞行等任务上的实际执行能力。
商业价值
- 降低研发与部署风险:通过仿真预筛失败模式,减少真实机器人试错成本,缩短模型选型与迭代周期。
- 提升模型可靠性:依据成功检查和执行轨迹分析,精准定位能力缺口,指导模型微调或架构改进。
- 优化资源分配:记录 token 消耗与成本,帮助团队在模型精度与计算开销之间权衡,控制推理成本。
与现有产品/工作流的接口
- 集成到机器人 CI/CD 流水线,作为仿真测试环节,类似软件回归测试。
- 与 Isaac Sim、Gazebo 等模拟器结合,复用其场景与物理引擎。
- 输出成功检查标准与执行记录,可转化为强化学习奖励或训练数据标签,用于后续模型训练。
具体 use case
- 电商仓储:用 RobotWorld 测试多模态智能体控制机械臂完成拣选、装箱、码垛任务,仿真验证后部署到真实仓库,减少硬件磨损与人工干预。
- 自动驾驶:将路线跟随、避障、泊车等任务作为测试场景,评估大模型驱动驾驶策略在复杂路况下的稳定性,辅助自动驾驶系统集成与安全验证。
局限
- **仿真到现实差距**:RobotWorld 作为一个模拟测试平台,虽然覆盖了操作、移动操作、驾驶和空中控制等多种任务,但物理仿真引擎(如接触力学、刚体动力学、传感器噪声模型)仍无法完全复现真实世界的复杂性与不确定性。例如真实机器人执行器延迟、非刚性物体形变、光照与纹理变化、地面摩擦异质性等均未充分建模。因此,智能体在仿真中表现出的规划与反馈利用能力,迁移到实体机器人时可能面临显著下降。该基准的结果需要与其他真实机器人实验或更精细的域随机化仿真交叉验证,才可作为通用物理智能体可靠性的依据。
- **任务预算与成功检查的敏感性**:论文为每个任务设定了显式交互预算,并使用可执行的成功检查来判断是否完成。然而,这些设置会直接影响评估结果。例如,过紧的预算可能限制智能体进行必要的试错与恢复,而严格依赖特定物体状态的成功检查可能导致对智能体长期行为的误判——论文已观察到智能体在达到命令姿态后丢失任务相关物体状态,或错误地将未完成任务视为完成。不同任务域(如连续平衡 vs 抓取放置)对预算与检查的敏感度差异较大,可能使某些模型在特定任务上被系统性低估或高估。评估协议的参数需要更系统的敏感性分析,以便公平比较不同智能体。
- **模型评估的公平性与对比范围有限**:该工作评估了 Astra、Opus 5.5、Gemini、DeepSeek、Kimi 等多个前沿多模态智能体,但各模型通过不同的 API 接口调用,提示词、工具注册方式、上下文长度限制和生成温度等条件未必完全统一,可能导致性能差异部分源于工程配置而非模型本身能力。此外,论文仅专注于通用多模态智能体在机器人接口上的表现,未与专门训练的机器人控制策略(如基于 RL 或模仿学习的端到端模型)进行对比,因此无法量化通用智能体与专用系统之间的实际差距。这一缺位使得“通用智能体用于机器人”的可行性结论缺少一个关键的参照系。