行业新闻

北大等提出Data Pyramid,五层金字塔界定机器人训练数据

机器人训练数据怎么选?五层金字塔从真机到通用逐级折衷,系统回答数据来源与配方。

具身智能缺乏互联网级预训练捷径。北大等机构提出Data Pyramid框架,将机器人操作数据分为真机、UMI式、自我中心与外部视角、仿真、通用数据五层,以可规模化与机器人对齐为主轴,并讨论模型如何选择与混合数据。

正文摘录

![图片](https://image.jiqizhixin.com/uploads/article/coverimage/ede892d5-6252-4a94-9f2b-16fb4b7f5a42/075(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 多模态基础模型可以通过互联网规模的图像与语言学习「看」和「说」,但具身智能没有同样的捷径。机器人必须进一步理解物理状态与动力学,判断动作如何改变环境,并在真实世界中执行连续行为;这要求训练数据同时连接观察、状态、动作与物理后果。 围绕「什么数据能够支撑具身基础模型」这一核心问题,北大联合多家机构提出了具身操作数据金字塔的具体定义,将现有数据生态组织为 5 个互补层级:真机数据、UMI 式数据、自我中心与外部视角数据、仿真数据,以及通用视觉语言数据。 该框架以「可规模化程度」和「机器人对齐程度」之间的张力为主线,并从质量、多样性、可复用性和物理保真度 4 个补充维度分析每一层数据的价值与边界。在此基础上,研究者进一步从数据配方与动作表征出发,系统梳理具身大脑模型、视觉语言动作模型和世界动作模型如何选择、对齐与混合异构数据,并总结触觉、失败恢复、规模化采集、跨本体动作对齐、自我中心数据迁移和数据配方设计等开放问题。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-04原文

相关内容