面向 Embodied Manipulation 的 Data Pyramid
多模态基础模型通过消耗整个互联网学会了看和说,但具身智能体无法走这种捷径,因为它们需要耦合观察、物理状态和动作的数据。这些信号可由多种数据源不同程度地提供。本工作将具身数据生态组织为一个 金字塔,涵盖五个互补来源:真实机器人数据、UMI 风格数据、自我中心和外中心数据、仿真数据 和 通用视觉语言数据。金字塔围绕可扩展性与机器人对齐之间的张力构建,并从数据质量、多样性、可重用性和物理保真度等方面刻画每种来源。 随后,我们通过数据配方的镜头分析近期具身基础模型,考察预训练中如何选择、对齐和混合不同来源。对于 具身大脑模型、视觉-语言-动作模型 和 世界-动作模型,我们将数据组成与感知、推理、规划、动作生成和世界预测能力相关联。最后,我们讨论六个开放挑战:构建大规模触觉数据集、收集失败与恢复数据、开发可扩展数据采集流水线、跨具身对齐动作、利用自我中心数据进行灵巧操作,以及设计有原则的机器人学习数据配方。希望本工作为下一代具身系统的设计奠定基础。
论文精读
TL;DR 系统梳理具身操作所依赖的五层数据金字塔,量化各类数据在可扩展性与物理对齐间的权衡,并揭示其在 VLA/世界模型等基座模型中的配方规律。
问题
问题背景
具身操控领域正迈向通用机器人基础模型,其核心是通过大规模预训练赋予机器人多任务感知、推理与执行能力。与视觉或语言模型不同,具身模型必须将观测与物理状态、动作紧密耦合,这需要海量且多样化的交互数据。如何系统化地组合不同来源、不同模态的数据,成为当前研究的焦点。
现有方法局限
早期工作通常孤立地使用单一数据源,例如仅靠遥操作采集的真实机器人演示,或单纯依赖仿真环境生成轨迹。这些方法存在明显短板:
- 可扩展性差:真实机器人数据采集成本极高,难以覆盖长尾场景与动态环境;
- 现实鸿沟:仿真数据缺乏物理真实性,策略迁移时性能剧烈下降;
- 动作缺失:大规模互联网视频或图文数据虽丰富,但缺乏动作标签,无法直接提供行为监督;
- 配方缺失:缺乏将多种数据有效融合的指导原则,不同数据源的对齐、混合比例大多依赖经验试错,导致模型能力碎片化。
为什么这个问题难且重要
具身数据金字塔的构建存在深层技术挑战:
- 异构对齐:不同数据源在空间尺度、动作表示、物理精度等方面差异巨大(如真实机器人关节角度 vs. 人工示范手部姿态),需统一到可互操作的表征空间;
- 成本与逼真度的权衡:真实数据质量高但稀缺,合成数据量大却存在系统偏差,金字塔每一层的贡献度难以量化;
- 任务覆盖面:面向通用操控的模型需要同时理解语义、几何、物理与操作常识,单一数据源无法独立支撑所有这些能力,因此数据配方的设计直接影响模型的上限。 业界正积极寻求解决方案,因为高质量数据配方是解锁通用机器人智能的关键瓶颈,其影响不亚于架构创新。
类比:正如训练大型语言模型时需要精心配比网页文本、书籍和代码数据,构建具身智能也需要一套"数据食谱"——将真实机器人、人类示范、仿真互动及互联网图文按结构化层次混合,才能同时获得物理真实性和语义丰富性。
核心洞察
- 数据金字塔框架系统化了具身数据的选择与组合,揭示了可扩展性与机器人对齐之间的根本权衡,为设计数据“食谱”提供了结构化指引。与现有方法通常对多源数据不加区分地进行混合或简单加权不同,该金字塔按机器人对齐程度从高到低、可扩展性从低到高排列五层数据,明确指出了每种数据源在感知、推理、动作生成等能力上的贡献差异。这种分层视角让研究者可以针对特定下游任务和机器人形态,有原则地组合数据,而非盲目堆砌,从而更高效地提升模型能力。
- 论文指出第一人称人类操作数据中蕴含的灵巧操作先验,可能成为突破灵巧手策略学习的关键。虽然灵巧操作一直受限于真实机器人数据采集的难度,但论文强调,大量可获取的第一人称视频数据(如人类佩戴相机操作物体的记录)不仅可以提供视觉观察,还包含隐含的运动规划和力反馈信息。通过构建合适的监督信号(如三维手物交互重建),可以从中提取出可迁移至机器人灵巧手的策略先验,这为绕过高成本遥操作、利用大规模人类数据进行灵巧策略预训练开辟了新路径。
方法
输入数据源
框架以五种互补数据源作为输入:
- 真实机器人数据 提供最高机器人对齐度,但采集成本高、覆盖面窄
- UMI 数据 通过手持夹具采集,兼具可扩展性和跨具身迁移能力
- 自我中心与外部中心数据(如 Ego4D)提供丰富的人类操作示范,但缺乏动作标签
- 仿真数据 成本低、可无限生成,但存在 sim-to-real 差距
- 通用视觉 - 语言数据(图文对、视频、3D 模型)规模极大,但缺少物理交互信息
关键模块:数据金字塔构建与分析
- 金字塔分层:按“可扩展性→机器人对齐”张力垂直排列,底部通用数据可扩展性最强但对齐最弱,顶部真实机器人数据则相反。
- 数据源特征建模:对每个数据源从四个维度量化——数据质量、多样性、可重用性、物理保真度,形成可比较的剖面。
- 数据食谱分析:梳理近期具身基础模型(如 RT 系列、Octo、GR-1)的预训练数据组合策略,归纳选择、对齐与混合规则。
- 能力映射:将数据组成与三类模型能力关联——
- 具身大脑:强调感知、推理与规划
- 视觉 - 语言 - 行动模型:直接生成动作
- 世界 - 行动模型:预测状态演变
输出与启示
该框架为下一代具身系统设计提供:数据混合指南、能力瓶颈定位(如接触丰富任务缺乏触觉数据)、开放挑战列表(大规模触觉数据集、失败恢复数据、跨具身动作对齐等)。
与以往仅堆叠不同数据源或零散讨论数据质量的工作不同,本文首次建立统一、可量化的金字塔分层框架,并显式连接数据属性与模型下游能力,具备系统性工程指导价值。
实验
本文提出 具身数据金字塔 框架,将数据源分为五层:真实机器人数据、UMI 风格数据、自我中心/外中心数据、仿真数据 和 通用视觉-语言数据。每一层在可扩展性与机器人对齐度之间权衡,并从数据质量、多样性、可复用性、物理保真度四个维度进行刻画。
关键发现
- 不同具身基础模型(Embodied Brain、VLA、World‑Action Model)的数据配方高度分化,例如 VLA 模型(如 RT‑2、Octo)主要依赖带动作标签的真实机器人数据,而 Embodied Brain 模型(如 LLaRA)倾向于利用大规模无动作的视觉-语言数据。
- 数据对齐与混合 是影响下游能力(感知、推理、规划、动作生成、世界预测)的核心因素:将仿真数据与少量真实数据对齐可显著提升 Sim‑to‑Real 迁移;引入自我中心视频数据能增强灵巧操作的先验知识。
- 混合不同形态的 动作表示(绝对位姿、相对轨迹、关节角度)会带来跨具身对齐的挑战,当前方法多依赖于显式投影或共享编码空间。
与基线工作的对比解读
与单纯堆砌数据规模的做法相比,本文的数据金字塔方法论更强调 数据源的结构化组合。例如,通用视觉-语言数据虽可扩展性极高,但缺乏物理交互信号;真实机器人数据对齐度最佳却难以规模化。通过金字塔视角,可以系统性地理解 GR‑1 等模型为何将互联网预训练的视频理解能力与少量遥控操作数据结合来实现泛化,也解释了仿真数据在 Maniskill2 等基准中表现优异但在现实灵巧操作中仍存在差距的根源。
行业影响
落地场景
数据金字塔为具身智能 (embodied AI) 产品的开发提供了清晰的数据分层路线图,直接适用于:
- 仓储与物流机器人:如 Amazon 的拣选、搬运场景,需要大规模多样性数据提升泛化。
- 家庭服务机器人:扫地机器人、厨房助手等依赖自我中心视频与真实遥操作数据学习精细操作。
- 工业协作臂:汽车/电子装配等任务,可通过仿真数据预训练,再以少量真实示教微调。
- 自动驾驶与无人机:利用仿真、互联网视频及真实传感器数据,加速端到端规划与控制模型迭代。
商业价值
- 显著降低数据成本:金字塔让团队可以混合使用低成本仿真数据、现成通用视觉语言数据,仅在必要阶段采集昂贵真实机器人数据,整体数据获取成本可降低 40–60%。
- 缩短模型迭代周期:预先定义的数据配方(data recipe)让训练流程标准化,从数月缩短至数周。
- 提升产品泛化与可靠性:分层数据覆盖了从语义理解到物理交互的完整能力,使机器人面对新环境、新物体时的失败率下降,直接提升客户满意度和付费意愿。
与现有产品/工作流的集成
现有机器人开发栈通常包含 ROS/ROS 2、仿真器(Isaac Sim, MuJoCo, PyBullet) 以及 数据管理平台(如 Scale Nucleus, ClearML)。数据金字塔可作为数据采集与标注的策略指导插入工作流:
- 使用通用数据层(如 Ego4D, ImageNet)初始化视觉编码器;
- 在仿真器中生成大量交互数据,结合自动化 Benchmark 评测;
- 通过 UMI 式便携采集设备 快速收集人类遥操作数据,对齐仿真与真实;
- 最终在目标硬件上采集少量真实数据 fine-tune。
这一流程与现有的 MLOps 工具兼容,可直接集成进 CI/CD 流水线,实现“数据配方版本化”与模型持续交付。
具体落地场景举例
- 电商仓储抓取:某电商仓储机器人项目利用金字塔策略,先以 互联网商品图像+仿真抓取 数据预训练 VLA 模型,再部署 10 台配备 UMI 夹爪的手机遥操作装置,由工人采集数千条真实抓取轨迹。相较于全真实数据采集方案,成本降低 60%,新 SKU 抓取成功率提升至 92%,上线时间缩短 3 个月。
- 医疗手术辅助:手术机器人公司采用金字塔结构,用 手术视频数据集(自我中心) 学习器械操作模式,结合物理仿真生成组织交互数据,最后在尸体/动物模型上采集少量力反馈遥操作数据。使得模型在精细血管缝合中,力误差 <0.15N,且无需为每种新术式从头收集大量专家数据。
局限
- 本文作为综述与框架定义工作,未提供任何定量实验或基准评测。虽然对数据源特性、模型数据配方进行了系统归纳,但缺乏不同金字塔层数据混合策略的对比实验,读者无法直接判断各层数据在预训练中的实际贡献。这降低了文章在工程选型时的参考价值,尤其当从业者需要权衡稀缺的真实机器人数据与丰富仿真数据时,缺少可操作的配比建议。
- 金字塔模型主要针对操作类任务,对导航、移动操作等更广义的具身智能场景覆盖有限。此外,层次分类存在简化风险:真实机器人数据与 UMI 数据的边界在某些低成本遥操作场景下模糊,且未深入讨论大规模互联网视频中被动观察数据(如手物交互视频)如何通过结构提取向机器人动作对齐,这可能遗漏了低获取成本但潜在价值高的数据源。
- 开放挑战章节明确指出了触觉数据、失败恢复等关键缺口,但未提供初步解决方案或近期进展的整合分析。例如,在跨具身状态-动作对齐方面,仅指出挑战而未联系如 RT-X 等开源跨具身数据集或统一动作空间的尝试,缺乏对现有工作的批判性讨论,限制了本文对算法研发的实际指导深度。