黎曼动力联合光轮智能与诺亦腾机器人 冲刺百万小时具身数据
三家国产公司联手冲刺100万小时具身数据,尝试打通模型、数据与仿真闭环,为具身智能规模化验证铺路。
黎曼动力刚拿下仿真和真机双SOTA,随即联合光轮智能和诺亦腾机器人,计划到2026年底采集100万小时机器人训练数据,力争成为全球首个达到该规模的公司。此前黎曼动力已用23.2万小时数据训练出Riemann-1.0,初步验证了技术路线。
正文摘录
刚拿下仿真、真机双 SOTA 的黎曼动力,转头拉上光轮智能和诺亦腾机器人,组了个新局。 到 2026 年底,完成 100 万小时机器人训练数据采集,力争成为全球首个突破这一规模的企业。 此前,黎曼动力已经用 23.2 万小时数据训练出 Riemann-1.0,初步验证了这条技术路线。 为什么机器人 demo 肉眼可见越来越丝滑,但离真正走进家庭和工厂却始终隔着一层玻璃? 由于无法像大语言模型一样,从互联网直接获取海量训练数据,具身模型的处境目前一直很微妙。 结果忙到现在,相比互联网语料动辄万亿 Token,机器人训练数据还普遍停留在数千到数万小时,达到数十万小时的模型依然屈指可数。 Physical Intelligence 训练 π0 时,使用了超过 1 万小时机器人数据,在当时已是最大规模的机器人学习实验之一。 英伟达最新的 GR00T 1.7,公开披露的真实示教、人类第一视角和仿真数据加起来,也只有约 4 万小时。 △图源英伟达官方 Blog 谷歌 DeepMind 为了把数据规模做上去,甚至联合全球 20 多家机构,才凑出覆盖 22 种机器人本体的 100 多万条轨迹。 真机数据负责练就精准控制,人类视频负责理解真实世界的丰富语义,仿真数据则负责补足那些危险、稀有或长尾的任务场景。 采集方不知道模型真正缺什么,模型公司很难独自包办真实采集和仿真,仿真平台生成的数据也需要经过模型训练和真机表现验证。 模型发现问题,采集补充数据,仿真放大场景,评测验证效果,再把失败反馈给下一轮训练。 三方要做的,是让数据生产第一次真正跟着模型需求转起来,而非简单拼出一个更大的数据库。 至于 100 万小时,虽然它未必是一条能力突然涌现的魔法线,却可能让具身智能第一次有机会在足够大的尺度上验证 Scaling。