行业新闻

生数科技发布 Motus2 世界模型,探索机器人递归自我改进

生数科技发布 Motus2 世界模型,用 Action-first 信息流和基于模型的强化学习让机器人预测并评估自己的动作,是把递归自我改进(RSI)思路落到具身智能上的一次尝试。

机器人不可能靠人类示范所有情况,想让它越干越好,就得能自己评价动作结果并从反馈中继续学习。生数科技最新发布的 Motus2 在这方面做了尝试:把触觉、灵巧操作、Ego 数据等热门方向整合进一个世界模型,让同一个模型同时具备行动、预测和评估能力,并形成闭环。

正文摘录

这正是机器人 “自进化” 让人期待的原因:人类不可能替它示范所有情况,想让机器人越干越好,就需要它有办法评价动作的结果,并从反馈中继续学习。 生数科技最新发布的 Motus2,在这方面做了一次不错的尝试,走入了当前具身智能研究中的深水区。 除了“自进化”,它还颇有些集大成的意味:触觉、灵巧操作、Ego 数据……当前具身圈的几个热门关键词,几乎都能在这个世界模型中找到对应。 今年 2 月,它的前代 Motus 发布时,世界动作模型的概念甚至还不成熟,而 Motus 在 50 项通用任务测试里,较 Pi-0.5 绝对成功率高出 35% 以上。 在前代模型基础上,Motus2 进一步拓展视觉、语言、动作与触觉等模态,在一个模型里同时点亮三棵技能树:行动、预测、评估。 它既能撸起袖子干活,又能提前脑补“动作之后会发生啥”,还能事后给自己打分。三种能力无缝衔接,形成闭环。 这也是当前行业的主流范式,模型只记住了“看到 A 就做 B”的统计关联,却不理解 B 为何能导致期望的结果 C。一旦环境变了,这种缺乏因果认知的策略便会迅速失效。 模型自己预测和评估出的结果,成为改进自身策略的反馈;改进后的策略,又进入下一轮迭代。这也是 Motus2 对递归自我改进(Recursive Self-Improvement,简称 RSI)的一次初步探索。 需要说明的是,这里的“自进化”,指的是利用模型自身的预测和价值反馈持续改进策略,并不意味着机器人已经能在开放环境里无限自主学习。 想让同一个模型既能“上手干活”又会“预判未来”,就得先解决一个核心问题:绝不能让它在做动作之前,就提前“偷看”到动作执行后的结果。 这是时序上的作弊,一旦发生,即便模型在训练集上看着很聪明,换到真实场景就会立刻露馅。

阅读原文(qbitai.com)→

行业新闻林, 方舟2026-09-14原文

相关内容