论文

μ0: 可扩展的3D交互轨迹世界模型

μ0: 可扩展的3D交互轨迹世界模型

问题: 现有世界模型要么预测密集像素(耗费模型容量于外观重建),要么直接建模动作(依赖具身化标签,限制可扩展性),难以在大规模机器人学习中通用。 方法: 本文提出 μ₀,一种基于3D轨迹的可扩展世界模型。不同于预测像素或动作,μ₀ 预测物体、工具、手部及接触区域等显著交互点的平滑3D轨迹,形成紧凑且与具身无关的运动接口。为从多样化视频源训练,TraceExtract 系统自动提取3D监督:选择关键点、构建全局对齐轨迹、将运动片段与分层语言描述关联。该监督预训练 μ₀,其结合预训练的视觉-语言骨干与模块化轨迹专家(每个查询通过 B样条控制点 表示,预测未来轨迹)。 实验: μ₀ 在2D/3D轨迹预测上优于基线(包括轨迹预测模型与tokenized VLM方法)。由于 μ₀ 冻结且可复用,可与动作专家配对用于下游机器人具身。尽管无动作预训练,生成的轨迹条件策略性能与使用动作监督预训练的 VLA模型(如 π₀)相当。 结论: 3D轨迹被证明是跨具身操作的可扩展且可迁移的表示。

论文精读

TL;DR μ₀:仅凭视频中3D交互轨迹预训练的世界模型,无需动作标签即可预测关键点运动,为不同机器人形态提供通用、可扩展的操控表征,性能媲美有监督VLA模型。

问题

问题背景

机器人学习正从依赖特定实施例的动作标签,转向利用海量无标注视频建立世界模型(world model),以预测动作引发的物理变化,从而支撑更具可扩展性的策略学习。

现有方法的局限

  • 像素空间视频模型(如 Genie、Dreamer 系列)提供丰富的视觉先验,但将绝大部分模型容量消耗在稠密外观重建上,导致推理成本高,且易受光照、纹理等非本质因素干扰,难以提炼出与操控任务直接相关的运动表征。
  • 直接动作模型需要与特定机器人形态绑定的动作标签,数据采集成本高昂,且每换一种硬件就必须重新收集数据并训练,阻碍了跨实施例(cross-embodiment)的复用与泛化。

为什么这个问题重要且困难

核心挑战在于:如何在保留物理交互关键信息的前提下,构建一个既紧凑又足够通用的中间表征

  • 技术难点:从无动作标签的野外视频中自动提取全局一致的 3D 运动轨迹,并使其与语义语言描述对齐,需要同时解决关键点筛选、跨视角 3D 重建、运动分割与语言绑定等多重问题。
  • 业界关注度:随着机器人数据规模竞赛陷入瓶颈,社区越来越重视通过无动作预训练(action-free pretraining)从互联网规模的视频中获取可迁移的物理知识,这是实现通用机器人智能的关键跳板。

行业类比:类似 NLP 领域用掩码语言模型从无标注文本中学习通用表征,μ₀ 试图用 3D 轨迹作为“操控世界的语言”,让机器人在无动作标签的情况下预训练理解物理交互,再高效适配到具体形态上。

核心洞察

  • 将3D交互点轨迹作为世界模型的预测目标,建立紧凑且具身无关的物理运动表征。与像素空间模型(将容量耗于稠密外观重建)和直接动作建模(依赖特定标签)不同,μ0预测关键点的B样条平滑轨迹,仅捕捉操作相关的几何变化,显著降低模型容量需求,同时天然具备跨机器人迁移能力。这种中间表征使世界模型能从海量无动作标注视频中学习物理先验,为通用机器人学习开辟了高效、可扩展的新范式。
  • TraceExtract自动化管线能从任意视频中提取时序一致的3D轨迹与分层语言描述,解决了跨具身数据匮乏难题。该方法通过语义关键点采样、全局3D对齐和事件驱动描述,无需动捕或人工标注,即可生成轨迹监督并关联运动段落的语义标签。这不仅支撑了μ0的无动作预训练,还为下游策略提供了可解释的运动指导,展现了以数据驱动方式扩展具身智能的可行路径。
  • 冻结预训练的μ0世界模型与可训练动作专家的模块化设计,实现了物理预测与策略学习的解耦,使同一世界模型可复用于不同机器人平台。实验表明,即使完全没有动作监督预训练,μ0加持的策略仍能与有监督预训练的VLA模型(如π0)竞争,验证了3D轨迹预测作为通用先验的有效性。这种解耦范式显著降低了新机器人部署时的预训练成本,推动世界模型向通用物理引擎演进。

方法

整体思路

μ₀ 是一种基于 3D 轨迹 (3D traces) 的可扩展世界模型,核心设计在于用紧凑的交互点运动轨迹替代密集像素预测或直接动作建模,从而实现形态无关 (embodiment-agnostic) 的机器人学习

数据管线: TraceExtract

输入为无动作标签的多样化视频。TraceExtract 从视频中自动抽取监督信号:

  1. 语义关键点采样 (Semantic Keypoint Sampling): 在帧中选择显著的交互点——物体、工具、手部、接触区域等。
  2. 3D 轨迹构建 (3D Trace Construction): 结合混和全局 - 局部三维重建与分块追踪,将关键点连成全局对齐的平滑轨迹
  3. 事件中心字幕 (Event-Centric Captioning): 将运动片段关联层级语言描述,形成“事件 - 运动”配对。

最终输出每条轨迹的 B 样条控制点序列及对应文本标签。

世界模型: μ₀

μ₀ 采用查询条件化框架,输入为初始几帧图像与用户定义的查询点 (query point),预测该点未来的 3D 轨迹。核心模块:

  • 多模态条件化骨干 (Multi-Modal Conditioning Backbone): 利用预训练视觉 - 语言模型编码图像与文本,提取时空特征,构建查询感知的上下文。
  • 置换等变轨迹专家 (Permutation-Equivariant Trace Expert): 采用流匹配 (flow matching) 目标,在连续空间生成轨迹。专家模块保证查询点之间的置换等变性,使模型能并行处理任意数量查询。每个查询的轨迹由 B 样条控制点 表示,以低参数量捕获平滑运动。
  • 语义结构保持: 流匹配过程加入语义先验,使预测轨迹贴合物体真实运动流形。

训练时 μ₀ 完全基于 TraceExtract 生成的轨迹监督,无需任何动作标签

下游适配

冻结的 μ₀ 作为可复用运动先验,与轨迹条件化动作专家 (Trace-Conditioned Action Expert) 配对。该专家以预测的 3D 轨迹为条件输出机器人动作,实现跨形态操控。

与同类方法的差异

区别于 π₀ 等直接动作模型(需形态特定动作标注)和像素空间视频模型(冗余外观重建),μ₀ 在 3D 轨迹的紧凑空间 中完成预测,兼具视觉先验的广度与动作模型的精度,且因 无动作预训练 获得更强的跨形态迁移能力。

实验

实验设计

μ₀ 的预训练完全依赖自动标注的 3D 轨迹监督,不涉及任何机器人动作标签。TraceExtract 从多样视频源中提取关键点、构建全局对齐轨迹,并为运动片段生成层次化语言描述,形成 (language, trace) 监督对。模型由预训练视觉语言骨干和模块化轨迹专家组成,每个查询点用 B 样条控制点 表示并预测未来轨迹。评估分两步:

  1. 2D 和 3D 轨迹预测 任务上直接对比基线(轨迹预测模型、tokenized VLM 方法)。
  2. 将冻结的 μ₀ 与下游动作专家配对,在 RoboCasa365 仿真 和真实机器人场景下测试操控策略,与使用动作监督预训练的 VLA 模型(如 π₀)比较。

关键发现

  • μ₀ 在 2D 与 3D 轨迹预测上均显著优于同类方法,验证了 稀疏交互轨迹 作为视觉运动表征的有效性。
  • 尽管 μ₀ 从未接触动作标签,其轨迹条件策略在下游操作任务中达到与动作监督预训练的 VLA 模型相近的性能。
  • 冻结的 μ₀ 可重用,显示 3D 轨迹是一种跨 embodiment 可迁移 的中间表征。

与基线的深度对比

传统世界模型要么预测高维像素(浪费容量在背景重建),要么直接建模动作(依赖特定 embodiment 标签)。μ₀ 选择了第三条路:只预测关键交互点的平滑 3D 轨迹,这是一种 embodied 无关的紧凑运动接口。相比 tokenized VLM 等基线,μ₀ 不仅在轨迹预测精度上领先,更关键的是无需重新训练就能迁移到新的机器人形态,只需替换动作专家——这为海量互联网视频预训练、多形态策略复用的工程路线提供了直接支撑。实验表明,即使面对从未见过的物体与工具,μ₀ 也能输出合理的运动轨迹,凸显了其视觉语义泛化能力。

行业影响

落地场景

μ_0 作为跨 embodiment 的 3D 轨迹世界模型,可直接赋能通用机器人操作学习,适合物流仓储(分拣、码垛)、制造业装配、医疗辅助、服务机器人等场景。其核心价值在于:同一套 3D 轨迹预测可适配不同形态机器人(机械臂、灵巧手、移动操作平台),无需为每种硬件单独采集动作标签。例如,在电商仓储中,仓库自动分拣系统可通过 TraceExtract 从海量人工作业视频中抽取 3D 轨迹,快速泛化到新 SKU 的抓取与摆放;在酒店服务机器人场景,模型能将“拿起杯子放到托盘”这样的自然语言指令转化为物体接触点的平滑运动轨迹,再交由下层的动作专家生成关节指令,降低部署定制成本。

商业价值

无动作预训练(action-free pretraining)大幅削减数据获取成本。传统机器人学习依赖遥操作或动捕采集大量 embodiment-specific 动作标注,而 μ_0 仅需大规模视频数据(例如 YouTube 操作视频、仓库监控录像)即可预训练出可复用的运动先验。在实际部署时,只需极少量带动作标签的机器人数据微调轨迹条件策略(trace-conditioned policy),即能达到与全量动作监督的 VLA 模型(如 π_0)相当的性能。这直接降低了机器人即服务(RaaS)的经济门槛,使中小型企业也能快速上线智能操作单元。此外,模型预测的是紧凑的 B-spline 控制点,而非密集像素,推理延迟低,适合在边缘设备实时运行,进一步优化了总体拥有成本。

与现有产品/工作流的接口

μ_0 设计为冻结、可复用的模块,可嵌入现有机器人软件栈:

  • 感知层:TraceExtract 作为数据预处理管道,接受 RGB-D 视频流,输出语义关键点、3D 轨迹及分层语言描述,可直接接入 ROS 2 节点或 MLOps 平台。
  • 决策层:μ_0 的 trace expert 接收视觉-语言多模态条件(如目标物体类别、任务描述),输出未来轨迹查询,然后由轻量级动作专家(例如扩散策略或 Transformer 头)转换为机器人关节指令。该动作专家可基于现有策略框架(如 Diffusion Policy、ACT)实现,仅需少量端到端微调。
  • 数据闭环:在持续学习场景中,机器人执行任务后回传的视频可通过 TraceExtract 自动打标,用于迭代提升世界模型,形成“预训练 - 适配 - 数据回收”的飞轮。

典型应用示例

  1. 跨境电商退货质检:机器人需处理形状、材质各异的退货商品。利用 μ_0 从人工质检操作视频中提取 3D 交互轨迹(如“拿起衣物→翻转→检查标签”),快速生成适用于不同夹具的轨迹条件策略,避免为每类商品编写手写动作规划。
  2. 智能厨房机器人:在商业厨房环境中,机器人需完成“切菜 - 倒入锅中 - 搅拌”等连续操作。通过 TraceExtract 分析厨师演示视频,μ_0 预测锅铲、食材接触点的 3D 运动轨迹,再结合力控动作专家,实现柔性食材处理,且同一模型可快速迁移至不同品牌的协作臂,提升方案复用率。

局限

  • **表示粒度局限**:3D trace 通过稀疏关键点的 B-spline 轨迹捕捉交互,属于紧凑的中间表示,但可能丢失精细的物体形变、接触力或视觉纹理信息。论文实验主要覆盖刚体对象和工具类操作,在可变形物体(如布料、面团)或非抓取式推移等需要细粒度物理建模的任务中,稀疏关键点可能无法充分编码状态变化,导致动作专家无法学习到精确的力控或形变适应策略。此外,语义关键点选择策略预设了“显著性”假设,可能忽略对任务至关重要但语义上不显眼的交互点。
  • **数据管道的噪声与误差传播**:TraceExtract 依赖于稳健的 3D 重建和全局对齐,对于单目低纹理视频、动态遮挡或极端视角变化,提取的 trace 可能含有显著噪声,进而污染世界模型的训练目标。尽管论文采用了 hybrid global-local reconstruction 和 progressive tracking 来缓解,但未对重建误差如何向下游策略性能传播做出定量评估。此外,自动事件分割和层次化语言标签的生成可能引入错配,降低预训练信号的纯净度,这也限制了在大规模、弱结构化互联网视频数据上的直接扩展应用。
  • **冻结世界模型与端到端适应的权衡**:μ₀ 在预训练后冻结并提供可复用的 trace 预测,保持 embodiment 无关性,但这也意味着世界模型不能在接受下游动作监督时继续更新以适配特定硬件的独特动力学。相比之下,某些联合训练或多任务微调方法可以在新机器人上同时调整世界模型与策略。在需要快速适应全新形态或奇特动作空间的场景下,这种一次性训练的方式可能不如持续学习方案灵活。此外,与直接预测动作的 VLA 模型(如 π₀)相比,引入中间 trace 表示增加了推理阶段的解耦步骤,可能带来额外的延时和累积误差,对毫秒级闭环控制任务构成挑战。
论文Seungjae Lee2026-06-11原文

相关内容