生数科技发布 Motus2 世界模型,探索机器人递归自我改进
生数科技 Motus2 把动作生成、结果预测、价值评估放进同一个世界模型,用自身反馈迭代策略,真机任务成功率最高提升 10 个百分点。
机器人不可能靠人类示范所有情况。生数科技发布的世界模型 Motus2 让机器人在一个模型里同时具备行动、预测和评估三种能力:先做动作,再预判结果,最后给自己打分,用这个反馈改进策略。这是对递归自我改进(RSI)的一次初步探索,也是当前具身智能的深水区课题。
正文摘录
这正是机器人 "自进化" 让人期待的原因:人类不可能替它示范所有情况,想让机器人越干越好,就需要它有办法评价动作的结果,并从反馈中继续学习。 生数科技最新发布的 Motus2,在这方面做了一次不错的尝试,走入了当前具身智能研究中的深水区。 除了 "自进化",它还颇有些集大成的意味:触觉、灵巧操作、Ego 数据……当前具身圈的几个热门关键词,几乎都能在这个世界模型中找到对应。 今年 2 月,它的前代 Motus 发布时,世界动作模型的概念甚至还不成熟,而 Motus 在 50 项通用任务测试里,较 Pi-0.5 绝对成功率高出 35% 以上。 在前代模型基础上,Motus2 进一步拓展视觉、语言、动作与触觉等模态,在一个模型里同时点亮三棵技能树:行动、预测、评估。 它既能撸起袖子干活,又能提前脑补 "动作之后会发生啥",还能事后给自己打分。三种能力无缝衔接,形成闭环。 这也是当前行业的主流范式,模型只记住了 "看到 A 就做 B" 的统计关联,却不理解 B 为何能导致期望的结果 C。一旦环境变了,这种缺乏因果认知的策略便会迅速失效。 模型自己预测和评估出的结果,成为改进自身策略的反馈;改进后的策略,又进入下一轮迭代。这也是 Motus2 对递归自我改进(Recursive Self-Improvement,简称 RSI)的一次初步探索。 需要说明的是,这里的 "自进化",指的是利用模型自身的预测和价值反馈持续改进策略,并不意味着机器人已经能在开放环境里无限自主学习。 想让同一个模型既能 "上手干活" 又会 "预判未来",就得先解决一个核心问题:绝不能让它在做动作之前,就提前 "偷看" 到动作执行后的结果。 这是时序上的作弊,一旦发生,即便模型在训练集上看着很聪明,换到真实场景就会立刻露馅。