北大等提出Data Pyramid,五层金字塔界定机器人训练数据
机器人训练数据怎么选?五层金字塔从真机到通用逐级折衷,系统回答数据来源与配方。
具身智能缺乏互联网级预训练捷径。北大等机构提出Data Pyramid框架,将机器人操作数据分为真机、UMI式、自我中心与外部视角、仿真、通用数据五层,以可规模化与机器人对齐为主轴,并讨论模型如何选择与混合数据。
正文摘录
.jpg)  多模态基础模型可以通过互联网规模的图像与语言学习「看」和「说」,但具身智能没有同样的捷径。机器人必须进一步理解物理状态与动力学,判断动作如何改变环境,并在真实世界中执行连续行为;这要求训练数据同时连接观察、状态、动作与物理后果。 围绕「什么数据能够支撑具身基础模型」这一核心问题,北大联合多家机构提出了具身操作数据金字塔的具体定义,将现有数据生态组织为 5 个互补层级:真机数据、UMI 式数据、自我中心与外部视角数据、仿真数据,以及通用视觉语言数据。 该框架以「可规模化程度」和「机器人对齐程度」之间的张力为主线,并从质量、多样性、可复用性和物理保真度 4 个补充维度分析每一层数据的价值与边界。在此基础上,研究者进一步从数据配方与动作表征出发,系统梳理具身大脑模型、视觉语言动作模型和世界动作模型如何选择、对齐与混合异构数据,并总结触觉、失败恢复、规模化采集、跨本体动作对齐、自我中心数据迁移和数据配方设计等开放问题。