RoboDojo基准测试:机器人操作模型真实世界成功率仅12.8%
RoboDojo 模拟具身智能“高考”,模型表现惨淡,揭示通用机器人操作仍停留在早期阶段。
最新基准 RoboDojo 对 30 个主流机器人策略进行仿真和真实世界测试,最强模型平均成功率仅 12.8%。它把能力拆成泛化、记忆、精细操作、长程执行和语义理解等关卡,暴露出现有模型“不够稳”的短板,距离可靠部署还很远。
正文摘录
一个个demo看起来越来越丝滑:叠碗、插管、收纳、倒水、整理桌面,机器人似乎终于开始听懂人话、理解世界、动手干活。 但问题是:这些模型到底谁更强?强在哪里?能不能从仿真走到真实世界?离真正的通用操作机器人,还有多远? 曾推出 RoboTwin 系列基准的原班团队,又带来了 RoboDojo :一个统一的仿真 + 真实世界机器人操作评测基准。 Website : https://robodojo-benchmark.com/ arXiv : https://arxiv.org/abs/2607.04434 Leaderboard : https://robodojo-benchmark.com/LeaderBoard Benchmark code : https://github.com/RoboDojo-Benchmark/RoboDojo XPolicyLab code : https://github.com/XPolicyLab/XPolicyLab Community : https://robodojo-benchmark.com/community 42 个仿真任务,18 个真实机器人任务,30 个主流机器人策略同台竞技,覆盖泛化、记忆、精细操作、长程执行、开放语义理解五大能力。 当前最强通用机器人策略,在仿真平均成功率也只有 8.80% 。到了真实世界,最好模型平均成功率也只有 12.8% 。 机器人基础模型们看起来已经开始攀登具身珠峰,但 RoboDojo 的榜单显示:它们大多还在山脚适应高反。 --- RoboDojo 的难点,不在于简单堆任务数量,而在于它把机器人操作能力拆成了一组 更接近真实世界的“登山关卡” 。 比如在 泛化任务 中,桌面杂物最多可随机到 25 个,背景、光照、物体外观和布局都会变化;