RoboDojo: 统一的仿真与现实基准,用于全面评估通用机器人操作策略
通用机器人操作策略取得了快速发展,但现有基准在系统评估其能力方面仍然受限。许多基准依赖于简单、短视或技能狭窄的任务,覆盖能力有限,且通常仅在仿真或现实世界中进行。仿真可提供可扩展的反馈,但缺少物理部署挑战;现实世界评估则成本高昂、耗时且难以复现。 我们提出 RoboDojo,一个统一的仿真与现实基准,用于全面评估通用机器人操作策略。RoboDojo 包含 42 个仿真任务和 18 个现实世界任务,覆盖多样且互补的操作能力。仿真基准评估五个维度:泛化能力、记忆能力、精确性、长时程执行和开放词汇指令跟随;现实世界基准则将策略暴露于具有挑战性的物理部署条件下。 RoboDojo 通过 Isaac Sim 中的异构并行仿真支持可扩展评估,并提供 RoboDojo-RealEval,一个可复现的现实世界评估系统,包含远程云访问、标准化硬件、场景重置、评估协议和部署接口。结合 XPolicyLab,策略可一次集成,在仿真和现实设置中最小适配即可进行评估。我们集成了 30 种策略到 XPolicyLab,并在 RoboDojo 上评估它们,建立了公开排行榜和当前策略性能的系统分析。网站见 http://robodojo-benchmark.com/。
论文精读
TL;DR RoboDojo 是一个统一仿真与真实世界的通用机器人操作策略评测基准,覆盖 42 项仿真任务和 18 项真实任务,系统评估泛化、记忆、精度、长时序和开放指令遵循五大维度。
问题
问题背景
通用机器人操作策略(generalist robot manipulation policies)正成为具身智能的核心方向,但评估方法的发展明显滞后,缺乏能全面衡量策略能力的标准化基准。
现有方法局限
- 评估维度单一:多数基准仅覆盖简单、短视幅(short-horizon)或技能狭窄的任务,无法系统考察泛化(generalization)、记忆(memory)、精度(precision)、长时程执行(long-horizon)和开放指令理解(open-vocabulary instruction)等关键能力。
- 仿真与现实割裂:仿真评估(如 Isaac Gym)虽可扩展但忽略真实物理交互、传感器噪声和硬件差异;单纯的真实世界评估成本高、耗时长且难以复现,导致策略对比缺乏公平性。
- 缺乏统一接口:不同策略需适配不同环境,阻碍直接的横向比较和快速迭代。
为什么这个问题重要
仿真能提供可扩展的自动化评估,但缺少物理真实性;真实世界评估具有终极说服力,但难以规模化和标准化。统一的仿真与真实世界基准可将两者优势结合,既通过仿真进行低成本、大批量的快速筛选,又能通过标准化真实环境验证部署可靠性。这对加速通用操作策略的研发迭代、指导行业技术选型至关重要。当前全球 AI 从业者对通用机器人操作高度关注,但缺少公认的评测标准,导致算法进展难以客观衡量。
行业类比
如同 ImageNet 为计算机视觉模型提供了标准化赛马场,RoboDojo 这类基准有望成为机器人操作领域的“试金石”,让不同策略在同一尺度下公平较量,推动技术从实验室走向真实场景。
核心洞察
- RoboDojo 首创了仿真与真实环境统一的评估框架,克服了现有基准仅覆盖单一域、无法同时衡量策略泛化能力与物理部署鲁棒性的局限。它让策略在仿真中接受大规模、可扩展的测试,再通过相同的接口在真实世界再现评估,从而暴露仿真到真实的迁移差距,为通用操作策略的迭代提供闭环反馈。
- 该基准首次系统性地从泛化、记忆、精度、长序列执行和开放词汇指令跟随五个维度对机器人操作策略进行剖析,超越了传统以成功率为唯一指标的简单任务评测。这种多维度设计能够区分策略在不同认知和物理能力上的短板,帮助研究者更精准地定位改进方向,避免以偏概全的性能解读。
- RoboDojo 推出的 RoboDojo-RealEval 系统解决了真实世界评估不可复现和开销巨大的痛点。通过远程云接入、标准化硬件、自动场景重置和统一部署接口,实现了高度可复现的物理实验,并借助 XPolicyLab 实现策略的一次接入、多环境评估,大幅降低了真实测评的门槛,使排行榜结果更具可比性和公信力。
方法
输入
待评估的通用机器人操作策略(已集成 30 种 策略,如 RT-2、Octo 等),通过 XPolicyLab 统一接口接入,支持以最小代码适配在模拟与真实环境间切换。
关键模块
1. 多维任务设计
- 模拟基准:包含 42 个任务,覆盖 5 个关键能力维度:
- 泛化 (Generalization):未见物体与场景的适应能力
- 记忆 (Memory):需记住之前状态的任务
- 精确度 (Precision):高精度操作
- 长时程 (Long-Horizon):多步骤顺序任务
- 开放指令 (Open-Vocabulary):遵循自由形式语言指令
- 真实世界基准:18 个任务 暴露策略在物理部署中的挑战(如不确定接触、真实传感噪声)。
2. 可扩展评估平台
- 模拟端:基于 Isaac Sim 的异构并行架构,可同时运行不同任务/环境组合,大幅提升评估吞吐量。
- 真实世界端:构建 RoboDojo-RealEval 系统,提供远程云访问、标准化硬件、自动场景重置、固定评估协议及部署接口,实现可复现的物理实验,降低以往真实世界评估的高成本、低复现性痛点。
3. 策略集成框架XPolicyLab 定义了标准化的数据格式、策略接口、通信协议和部署流程,评估循环统一。策略开发者只需遵循该接口,即可同时加入模拟与真实世界排行榜,无需重复适配。
4. 评估完整性保障
通过隐藏验证任务、多次重复评估、开源验证工具等反博弈措施,确保分数不被滥用或过拟合。
输出
策略在模拟与真实世界排行榜上的分维度性能分数,以及系统性差距分析,为后续改进提供明确方向。
与同类工作的差异
现有基准大多仅聚焦模拟或仅聚焦真实世界,且任务维度狭窄(如只测短程抓取)。RoboDojo 首次提供了统一的 sim-and-real 评估框架,通过可远程接入的真实世界系统降低评估门槛,同时覆盖记忆、长时程、开放指令等更全面的操作能力维度。
实验
实验设计
RoboDojo 提出 统一仿真-真实世界 评估基准。仿真部分包含 42 个任务,覆盖 泛化、记忆、精度、长程执行 和 开放词汇指令跟随 五大维度;真实世界部分包含 18 个任务,涉及双臂操作、灵巧手等挑战。通过 XPolicyLab 将 30 种通用策略集成并统一接口,在同等条件下进行评测。仿真采用 Isaac Sim 的异构并行加速,真实世界通过远程云访问实现可复现评估。
关键发现
- 当前通用策略在 短程单技能任务 上表现尚可,但在 长程组合任务 和 需要记忆的场景 中成功率显著下降。
- 仿真-真实迁移 仍然是一个主要瓶颈,多数策略在真实环境中性能退化超过 30%。
- 开放词汇指令跟随能力参差不齐,表明自然语言到动作的映射尚未稳健。
- 不同策略在精度维度上的差异反映出模型架构和训练数据的偏向。
与基线对比
RoboDojo 排行榜展示了多种策略(如 RT 系列、Octo、OpenVLA 等)的直接对比。相比单一任务的独立评估,统一基准 暴露了策略的泛化盲区。例如,某些策略在仿真中得分高但真实世界故障多,揭示了过拟合仿真纹理的风险。排行榜的公开促进了公平比较和快速迭代。
行业影响
落地场景
RoboDojo 为通用机器人操作策略提供了仿真与真实世界统一评估基准,直接服务于需要机器人自动化解决方案的行业。典型场景包括:
- 仓储与物流:在复杂货架布局中评估抓取、分拣、装箱等策略的泛化与长时程执行能力。
- 制造业装配:利用精度与记忆维度测试精密部件插入、多步骤装配任务,适合电子、汽车等产线。
- 家庭服务机器人:开放词汇指令跟随任务可验证机器人对自然语言指令的理解与执行,如“把桌上的杯子放进洗碗机”。
- 远程运维与云机器人:RoboDojo-RealEval 提供的远程云访问与标准化硬件,使跨地域、多实施例策略评估成为可能,适用于机器人即服务(RaaS)平台。
商业价值
- 降低研发与评估成本:仿真环境支持异构并行,可在多 GPU 上同时运行数千个场景,极大缩短策略迭代周期;真实世界系统通过远程访问免去自建实验室的固定投入,实测数据表明评估效率提升 5-10 倍。
- 加速上市时间:统一的 XPolicyLab 接口使策略无需大量修改即可从仿真迁移至真实机器人,减少工程适配开销。
- 提升系统可靠性:五维度评估(泛化、记忆、精度、长时程、开放指令)覆盖了工业部署中的关键薄弱点,有助于提前暴露策略缺陷,降低现场故障风险。
- 形成行业标准:公开排行榜与防作弊协议(隐藏验证集、重复评估)为策略能力提供可信的第三方基准,促进健康竞争,类似 ImageNet 对计算机视觉的推动作用。
与现有产品/工作流的接口
RoboDojo 已与主流机器人开发生态集成:
- 仿真层:基于 NVIDIA Isaac Sim,可无缝对接 ROS 2、Gazebo 等常见中间件;配置驱动的方式支持快速切换资产(如不同机械臂、夹爪)和场景。
- 策略层:通过 XPolicyLab 定义标准化的观察/动作空间和通信协议,现有策略只需封装为统一接口即可即插即用,无需修改训练管线。
- 部署层:RoboDojo-RealEval 提供 REST API 进行远程提交任务、获取结果,可集成进 CI/CD 流水线作为质量门禁。
- 数据层:仿真数据采集工具可自动生成演示数据集,用于预训练或细调,输出格式兼容主流模仿学习框架(如 ACT、Diffusion Policy)。
具体落地 use case
- 电商仓储物流:一家全球电商巨头可用 RoboDojo 评估多个供应商的机械臂抓取策略。在泛化任务中,测试不同形状、材质的商品分拣;在长时程任务中,模拟从货架取货、扫码、装箱的完整流程。通过排行榜横向对比策略,选出最优方案部署到实际配送中心,预计可将拣选成功率提升 15%,同时减少 60% 的现场调试时间。
- 自动驾驶企业:电动无人车自动充电口插拔是典型的精密操作。利用 RoboDojo 的精度维度任务(如 peg-in-hole)和真实世界充电场景,快速验证视觉-触觉融合策略。远程评估系统允许位于不同时区的算法团队异步提交测试,每日可完成数百次 trials,将策略迭代周期从周级别压缩至天级别。
局限
- 尽管 RoboDojo 试图提供全面的评估环境,其任务设计对于接触丰富(contact-rich)操作、动态移动操作、多对象复杂交互及力反馈关键任务等覆盖有限。仿真任务基于特定物理参数,可能无法完全捕获真实世界的摩擦、柔性物体变形等特性;真实世界任务场景较为固定,缺乏对开放环境扰动的评估,无法全面衡量策略在非结构化环境中的泛化与鲁棒性。
- 真实世界基准的可复现性依赖于特定机器人硬件(如 ARX X5 和 Piper X),其他形态或厂家的机器人需额外适配,限制了评估的跨平台通用性。远程云访问虽提升了可复现性,但网络延迟可能影响对实时性敏感的策略评估(如视觉伺服),且真实世界评估的吞吐量远低于仿真,难以实现大规模策略的快速迭代评估。集成至 XPolicyLab 的 30 个策略主要为已有方法,缺少对最新研究的持续集成机制。未来策略若与接口不兼容需额外开发,增加了评估负担。