行业新闻

灵初智能发布 Psi-R2.5,用逆向世界模型生成人机强配对数据

机器人学人干活卡在数据对齐:灵初反过来用机器人数据生成人手数据,再拿它当训练材料和实时示范。

灵初智能在十万小时数据基础上改进 Psi-R2.5:不再从人手动作出发去生成机器人轨迹,而是以真实机器人数据为起点,用世界模型 Psi-W0 反向生成对应的人手操作,得到逐帧对齐、可在真机回放的"强配对数据"。这些数据既用于训练端到端转换器,也作为上下文学习(ICL,不更新参数、靠当前提示推断做法)的示范。

正文摘录

看这组对照视频:一边是人手操作,一边是机械手操作。乍一看,像是人先做了一遍,机器人再照着学。但顺序恰好反了——机械手那段才是真实记录,人手那段则是 AI 根据它生成出来的。 为了让机器人学人,为什么反而要从机器人的动作开始?这看起来有点绕,却指向了一个很实际的问题:人类每天都在干活,这些经验,到底怎样才能交给机器人? 就在上周,Figure 发布 Helix 2.5,使用人类行为数据集 Index 进行预训练,在完成三类家务任务的适配后,将机器人带进 30 个未采集过数据的家庭进行测试。 灵初智能这次进一步追问:人类数据进了模型,不等于人的操作经验就能被机器人直接使用。这中间,还缺什么? 在十万小时级数据积累的基础上,灵初智能的模型 Psi-R2.5 继续改进数据质量与人机数据对齐方法,并进一步推进具体任务适配。它关注的不只是让机器人看过更多操作,还包括怎样把这些操作变成有效的训练材料,以及面对新任务时,怎样更容易地教会它。 人和机器人,都能拿起一瓶可乐。但两段 "拿可乐" 的视频放在一起,就能教机器人照着做吗? 这里面仍然存在一些 "老生常谈" 的问题:人手和机械手不仅长得不一样,关节结构、接触物体时的摩擦条件也不同。再加上人手姿态估计的误差,一个人可以顺利完成的动作,转换成机器人的关节运动后,未必还能成功。 所以,给机器人看懂 "这是在拿可乐",和提供一份 "可以这样拿起可乐" 的动作数据,是两回事。 灵初把人和机器人执行类似任务、主要在任务含义上对应的数据,称为 "弱配对数据"。它更希望获得的,是另一种对应关系:除了人和机器人本体不同,两边的场景基本一致,动作时序逐帧对应,而且机器人一侧的动作能够在真机上直接回放成功,这就是 "强配对数据"。 强配对数据强调对齐,不只是要求人和机器人 "都做了同一件事",而是 "人的这段操作,对应着机器人这段可执行的动作"。

阅读原文(qbitai.com)→

行业新闻思邈2026-09-24原文

相关内容