原力灵机开源具身智能模型DM0.5 登顶RoboDojo榜单
原力灵机开源的DM0.5证明了具身智能模型的高上限,通过统一架构和记忆机制,在苛刻评测中领先并开源,为行业提供了可复用的方法论。
具身智能(让机器人感知并操作物理世界的AI)模型DM0.5在RoboDojo评测中登顶。该评测由全球近20所学术机构发起,难度极高,头部模型平均成功率不足13%。DM0.5支持60秒记忆,能完成毫米级精度抓取,且代码与权重全面开源。
正文摘录
魔鬼级的具身评测,由香港大学多媒体实验室联合加州大学伯克利分校、清华大学等全球近 20 所顶尖学术机构共同发起。 这么说吧,截至 2026 年 7 月,仿真榜单头部模型平均成功率仅 8.80%,真机榜单仅 12.8%。 机器人先从左到右盖住随机排列的红、绿、蓝三个积木。当颜色被完全遮挡后,再根据此前观测,按红、绿、蓝的顺序依次揭开。 反映在数据上也很直观,RoboDojo 榜单中的 Memory 维度,DM0.5 直接猛砍了 47.74 分,显著领先。。。。 毕竟物理世界场景稀碎,你模型做得再好,总有泛化性覆盖不到的长尾任务,这类场景下鲁棒性会骤降特别多。 目前业内的共识解法是:不追求预训练解决一切,而是在落地环节引入 Human-in-the-Loop。让人类工作者拍摄一段示范视频,机器人便能像开了「写轮眼」一样即时对齐并跟随完成复杂任务。 DM0.5 原生支持最长 60 秒的记忆能力,机器人能深度记住并连贯审视自己此前做过的所有动作序列。 是的,6 台机器人,耗时 15 小时,用 81920 块微型积木拼出长 3.5 米的长城模型。 积木拼装,最小的组件宽度不到 1 厘米,机器人必须在 0.1 到 1 毫米的尺度内完成抓取和扣合。这个精度,已经超越了人手约 0.3 到 1 毫米的自然抖动极限。 毕竟是模型嘛,高精度任务确实没法追求把把 zero-shot,还是得靠 Loop 保证稳定性。 传送带不停,每个包裹的尺寸、材质、摆放姿态都不一样,传统机械方案根本干不了这类任务。 DM0.5 不依赖预设脚本,纯靠实时视觉识别和决策,平均 3 秒一单,准确率超 99%。 DM0.5 的解法是分层双系统,即业界主流的 System1 与 System2 架构。 Sys1 则是动作专家网络。就像人类的直觉反射,负责 handle 长程复杂任务中的琐碎细节。