论文

RoboJEPA: 机器人潜在世界模型的规模化

RoboJEPA: 机器人潜在世界模型的规模化

潜在世界模型 在预测未来状态与真实世界规划上表现亮眼,但实践中我们缺乏一套原则性方法,来估计其能力如何随模型规模、数据与 compute 扩展,这一开放问题长期拖慢领域进展。 本工作提出 RoboJEPA,一个基于 Joint Embedding Predictive Architecture (JEPA) 的世界模型,在覆盖 12 种机器人本体 的大规模数据集上训练。我们发现,RoboJEPA 的 想象误差 (imagination error),即其潜在 rollout 的误差,随 compute 呈 二阶幂律 变化,使我们能在远超幂律拟合尺度的范围内预测模型质量。 - 下游机器人规划性能同样随 compute 可预测地提升,且 想象误差 与之强相关,可作为真实机器人评测的可靠代理指标。 - 潜在世界模型还能 zero-shot 部署为机器人 agent,仅凭单张目标图像进行规划,在真实硬件上完成需要长程规划的任务。 我们已开源全部模型 checkpoint 以及训练与机器人部署代码。据我们所知,这是首个为基于真实机器人数据训练的多本体机器人世界模型建立 scaling laws 的工作;而 8B 参数的 RoboJEPA,也是迄今最大的 JEPA 预测器模型。

论文精读

TL;DR RoboJEPA 是 8B 参数的机器人潜在世界模型,基于 JEPA 在 12 个 embodiment 上训练,首次为真实机器人数据建立 scaling laws:imagination error 随 compute 呈二阶幂律,可预测规划性能并 zero-shot 部署。

问题

问题背景

机器人学习社区近年聚焦于世界模型(world models),希望利用其预测未来状态的能力支撑规划与决策。

现有方法局限

此前工作大多基于单具身或少具身数据训练,模型规模有限,且缺乏系统性方法评估能力随 model size, data, compute 的扩展规律。具体限制包括:

  • 无法从已训练的小规模模型推断更大模型或更多数据下的表现,迭代依赖经验试错;
  • 缺少一个可靠、低成本的评估 proxy,真实机器人评测昂贵且耗时;
  • 跨具身泛化能力差,难以利用不同机器人数据协同训练;
  • 长时程 rollout 误差累积,预测质量随 horizon 增长迅速恶化。

为什么这个问题难/重要

建立机器人世界模型的 scaling laws 面临独特挑战:真实机器人数据收集成本高、具身异构性强(不同自由度、传感器、控制频率),且多源数据格式、动作空间不一致。但该问题至关重要:如果能像 LLM scaling laws 一样预测模型能力,研究者可以更有信心地分配算力和数据,加速领域进步。业界关注度很高,语言和视觉领域的 scaling 成功经验尚未迁移到机器人。

行业类比

类比 GPT 系列 通过 scaling laws 指导大语言模型训练,RoboJEPA 试图为机器人世界模型提供类似的“算力-性能”预测曲线,支撑下一代机器人基础模型开发。

核心洞察

  • RoboJEPA 首次在多 embodiment 真实机器人数据上为隐世界模型建立 scaling laws:imagination error 随 compute 遵循二阶幂律,可外推预测更大模型质量。与以往大多在单一 embodiment 或仿真数据上的 JEPA 研究不同,这项工作利用 12 种机器人形态的统一处理与大规模训练,证明了隐空间预测误差可以像 LLM 的 loss 一样作为可预测的扩展指标,为机器人基础模型的计算资源分配提供了经验依据。
  • imagination error 可作为真实机器人规划性能的可靠代理指标,替代昂贵的硬件评估。作者发现该指标与下游 planning 成功率强相关,并随 compute 可预测提升,这使得团队可以在低成本下快速筛选模型 checkpoint 并调整训练规模。与常规依赖仿真 benchmark 或生成质量指标的方式相比,这种代理指标直接绑定 latent rollout 质量,显著缩短了从模型训练到真实硬件验证的迭代周期。

方法

方法概览

RoboJEPA 采用联合嵌入预测架构 (JEPA),训练于 12 种机器人 embodiment 的大规模真实数据。输入涵盖多视角 RGB 视频、本体感知与动作序列,经统一格式和 per-embodiment 输入投影后送入编码器。编码器提取潜在表征,预测器在潜在空间执行多步 rollout,产生 imagination error 作为核心训练信号。关键模块包括 factorised multi-axis RoPE、分组查询注意力下的 per-block 视图偏置、注意力掩码,以及 view-mixed-rank 训练策略,支持多相机、多分辨率的混合训练。扩散解码器仅用于可视化,不参与闭环训练或规划。

输出为未来潜在状态序列,可直接用于 zero-shot 机器人规划:给定单一目标图像,通过 CEM 在潜在空间优化动作序列,部署至真实硬件执行长程任务。

工程启示:imagination error 与真实规划性能强相关,可作为真实机器人评估的低成本代理指标;算力增加带来可预测的规划性能提升,便于训练资源规划。

与同类方法差异:RoboJEPA 首次在真实多 embodiment 机器人数据上建立潜在世界模型的幂律缩放律,其 8B 参数 JEPA 预测器为当前规模最大。

实验

实验设计

作者训练了多 embodiment 的 RoboJEPA 世界模型,参数规模达 8B,训练数据覆盖 12 种机器人形态。通过在不同计算预算下训练模型,考察 imagination error(潜在 rollout 误差)的缩放规律。此外,在下游机器人规划任务中评估性能与计算的关联,并在真实硬件上测试零样本规划能力(给定单个目标图像)。

关键发现

  • imagination error 遵循 二阶幂律,使得可以在拟合范围之外预测模型质量。
  • 下游规划性能随计算可预测提升,且与 imagination error 强相关,表明 imagination error 可作为真实机器人评估的可靠代理。
  • 零样本部署:模型仅凭单张目标图像即可在真实机器人上完成长时程规划任务。
  • 8B 参数 RoboJEPA 是迄今最大的 JEPA 预测器。

对比与启示

相较于以往针对单一 embodiment 或模拟环境的世界模型缩放研究,RoboJEPA 首次在多 embodiment 真实机器人数据上建立缩放律。其幂律关系为工程实践提供了明确的资源分配依据:可以提前预测增大模型或数据带来的收益。同时,imagination error 作为无需真实硬件即可评估的指标,有望大幅降低机器人学习中的实验成本。该工作将 JEPA 架构扩展到 8B 规模并验证其在下游规划中的效用,为构建通用机器人世界模型提供了重要参考。

行业影响

落地场景

RoboJEPA 的 latent world model 可直接用于 机器人操作 / 仓储物流 / 家庭服务 等产品研发。其 zero-shot 长期规划能力(向单张 goal image 规划)适合 视觉导航、物品抓取、复杂操控 场景,且 多机器人形态统一建模 降低每款机器人单独训练成本。

具体落地场景:

  • 电商仓储:移动抓取机器人根据目标商品图像规划多步操作,无需新环境微调。
  • 自动驾驶 / 工业质检:利用可预测的 imagination error 做仿真评估和策略筛选,减少真实硬件测试。

商业价值

主要价值在 降本与加速迭代:

  1. 训练成本可预测:scaling law 允许较小规模拟合幂律,预测大模型质量,避免盲目投入。
  2. 真实硬件评估替代:imagination error 与下游规划性能强相关,可作为 proxy 减少真机实验。
  3. 跨 embodiment 复用:单模型覆盖 12 种形态,摊薄数据采集与模型维护成本。

长期看,这类似 LLM 的 scaling law 对基础模型投资的指导意义,可让机器人世界模型从“手工作坊”走向“可工程化”。

与现有产品 / 工作流的接口

  • 模型层:RoboJEPA 提供预训练 checkpoint(8B),可接入现有控制栈作为 world model predictor 或 planner。
  • 数据层:标准化多来源机器人数据格式(含 action unification、per-embodiment projection),可对接企业已有 ROS / 机器人数据湖。
  • 推理优化:公开的 AOT Inductor 编译、FP8 静态量化路径降低部署延迟,适合边缘端。

集成方式:将 RoboJEPA 作为 planning module 嵌入 MPC / CEM 框架,输出 latent rollout 并解码为 video 供调试;或作为 zero-shot policy 接收 goal image 生成动作序列。

局限

  • **数据和任务多样性受限。** 即使合并 12 种 embodiment,仍以桌面机械臂抓取/推物为主,缺少移动操作、多臂协同、高动态接触等任务;这可能导致 scaling law 的拟合偏向于当前数据分布,外推到其他机器人形态或任务时失效。
  • **外推不确定性。** 论文报告的 imagination error 在 compute 上呈二阶幂律,但该规律来自有限范围内的拟合;当数据量、模型规模进一步增长时,优化不稳定、数据瓶颈或表示容量饱和都可能导致偏离。此外没有系统消融数据量、模型宽度、深度等维度。
  • **零样本真实部署能力有限。** 实验虽展示 goal-image planning,但测试任务多为短程 pick-place,且缺乏与 MPC、RL 等强基线的定量比较;长程规划中 latent rollouts 的累积误差会降低可靠性,对需要闭环重规划或接触丰富任务的效果存疑。
论文Artem Zholus2026-10-07原文

相关内容