机器人先到得了现场:具身数据赛道的新缺口
具身数据不能只采“手”,机器人本体如何移动的数据同样关键,却几乎无人供应,正成为新瓶颈。
具身智能训练数据大多聚焦机械手操作,但机器人先得走到现场。全球最大腿式机器人数据集仅5小时,本体运动数据严重稀缺,且只能由机器人实跑采集,无法靠人力外包补齐。这是三重结构性约束的结果,也是被低估的新赛道。
正文摘录
.jpg) 编辑|Panda 前几天,我在自家小区的业主群里刷到一条招聘广告:居家靠谱副业,AI 数据采集兼职。  这类广告已经不算新鲜了。今年 5 月,第一财经报道过一批「居家数据采集员」:他们戴着采集手套或者头戴相机,在自己家里择菜、叠衣服、开抽屉,把这些动作录成视频,卖给需要训练机器人的公司。据一家数据服务商透露,其百人左右的采集员队伍里,宝妈占比接近六成,居家岗位月薪在 3000 到 4000 元之间,社交平台上流传的日薪多在百元上下、时薪 25 元左右。 具身智能行业对数据的渴求,可见一斑。 但我盯着那条广告看了很久,想到的是另一件事: 这些兼职能采到的,全都是手(末端执行器)的数据,忽视了「机器人本体与环境交互的运动数据」。 所有人都在采数据 采的却是同一种数据 数据缺口有多大,行业已有计算。截至 2026 年初,全球高质量真实物理交互数据的总量大约只有 50 万小时 ,不足大语言模型训练语料的两万分之一。而按照产业界较为一致的口径,训练出一个真正可用的通用具身模型,至少需要 千万小时量级 。 于是资本和巨头一起涌了进来。