DreamX-Phi 1.0: 面向机器人操作的动作条件视频世界模型
我们提出了 DreamX-Phi 1.0,一个用于机器人操作的动作条件视频世界模型。给定一个观察帧、一条语言指令以及由末端执行器位姿和夹爪状态组成的指定动作序列,该模型能够预测未来的观察结果。然而,仅凭真实感并不能保证一致性:一个令人信服的推演仍可能移动错误的手臂或丢失被操作物体。为确保预测遵循每条手臂的命令路径,我们通过 PRoPE 风格的几何编码将每只手臂的 SE(3) 变换注入注意力机制,保留手臂身份和刚体运动结构。 仅靠动作控制不足以完全约束场景几何或小型被操作物体的演化。因此,我们添加了一个轻量级深度分支用于场景级几何,并使用 SAM3 掩码结合冻结的 V-JEPA 教师模型来在抓取过程中保持物体一致性。我们进一步通过分布匹配蒸馏将多步生成器蒸馏为少步学生模型,以实现高效部署。在撰写本文时,我们的方法在 WorldArena 2.0 挑战赛的 Track 1 中荣获第一名,在 Track 2 中荣获第二名。我们的模型和代码将公开提供。
论文精读
TL;DR DreamX-Phi 1.0 是一个动作条件视频世界模型,通过 SE(3) 几何注意力、深度分支与 SAM3 掩码保证生成未来帧既逼真又忠实于机器人动作,并在 WorldArena 2.0 挑战赛中斩获 Track 1 第一、Track 2 第二。
问题
问题背景
机器人世界模型(world model)通过当前观测、语言指令和动作序列预测未来场景,为规划提供可评估的想象空间。近年来视频生成模型带来了强大的外观与运动先验,显著提升了预测画面的真实感。
现有方法局限
但视觉真实感不等于动作忠实性。现有视频生成器在条件控制上存在明显缺陷:
- 动作对齐不足:给定同一初始帧,不同动作序列可能生成相似的机器人运动,导致错误的机械臂被移动或被抓物体状态与指令不符。
- 几何约束缺失:仅靠动作条件无法约束场景深度和小物体的位姿演化,预测帧中可能出现穿透、漂移或物体丢失。
- 长程一致性差:多步 rollout 中误差累积,物体在抓取过程中可能消失或变形。
为什么这个问题难/重要
- 技术挑战:需要把每个机械臂的 SE(3) 刚体变换注入注意力机制,同时保持臂身份与几何结构;还需辅助深度估计和物体分割/表示对齐,以维持场景与物体的一致性。
- 工程价值:世界模型被视为机器人基础模型的关键组件,能降低真实交互成本,加速仿真与规划算法迭代。若预测不可信,下游规划将产生灾难性误差,因此业界对动作可控、物理一致的世界模型有强烈需求。
行业类比
类似自动驾驶中的预测与规划联合模型:如果预测的未来轨迹不忠实于自车控制命令,仿真评估和决策优化将完全失效。
核心洞察
- DreamX-Phi 的核心创新在于将每个手臂的 SE(3) 变换通过 PRoPE 风格几何编码直接注入注意力层,而非简单地将动作向量拼接或作为交叉注意力条件。这种做法保持了刚体运动的几何结构,使模型在计算注意力时能够区分不同手臂并感知其姿态变化,从而减少预测中“动错手臂”或“动作变形”的问题。相比以往将动作作为普通 token 或嵌入的 baseline,几何编码提供了更强的动作忠实度约束,是视频世界模型从“看起来像”迈向“真正可控”的关键一步。
- 模型通过联合轻量深度分支与基于 SAM3 掩码的冻结 V-JEPA 教师进行一致性监督,显式约束场景几何与物体演化。纯 RGB 视频生成模型常在小物体被遮挡或抓取时出现物体漂移或丢失,而深度分支提供几何先验,V-JEPA 特征对齐则保持语义一致性。这种组合同时覆盖空间结构与对象身份,比单一深度损失或对象检测监督更全面地提升了物理可信度,为机器人操作中的长时程预测提供了更强的可靠性。
- 在部署层面,DreamX-Phi 采用分布匹配蒸馏而非常见的逐步蒸馏或一致性蒸馏,将多步扩散生成器压缩为少步学生模型。分布匹配蒸馏更直接地优化学生输出分布与教师分布之间的差异,能在保持预测多样性与质量的同时大幅降低推理步数。对于需要实时规划或大规模仿真的机器人应用,这一工程选择在计算效率和预测保真度之间取得了更好的平衡,体现了世界模型从研究原型走向实际落地的务实路径。
方法
输入与总体流程
DreamX-Phi 1.0 的输入包括当前观测帧、语言指令和动作序列(末端执行器位姿与夹爪状态)。模型基于视频生成骨干,输出预测的未来观测序列。整体流程上,先对动作进行几何编码并注入注意力层实现控制,再通过深度分支与物体一致性监督约束生成内容,最后以少步蒸馏压缩推理开销。
关键模块
- PRoPE 几何注意力控制:针对双臂场景,将每只手臂的 SE(3) 变换编码为 PRoPE 风格的旋转-位置嵌入,注入注意力层。该设计保留手臂身份与刚体运动结构,避免双臂信号混淆。
- 深度分支:加入轻量 depth decoder 提供场景级几何监督,使生成帧的 3D 布局更一致。
- 物体级物理一致性:利用 SAM3 提取物体掩码,将掩码区域特征与冻结的 V-JEPA 教师对齐,在抓取过程中维持小物体的外观与身份稳定。
- 少步蒸馏:通过 distribution-matching distillation 将多步生成器蒸馏为几步学生模型,降低部署成本。
输出与差异点
输出是与输入动作对应的未来帧序列。与仅追求视觉真实感的视频世界模型不同,DreamX-Phi 显式注入 SE(3) 运动约束并施加物体级监督,保证预测忠实于指令动作,而非仅仅 plausible video。
实验
实验设计
DreamX-Phi 在 WorldArena 2.0 挑战赛的两个 track 上评估:Track 1 和 Track 2。任务输入包括当前观测帧、语言指令、以及由末端位姿和夹爪状态组成的动作序列,输出未来观测视频。评估核心不仅看视觉真实感,更关注动作忠实度——即生成视频中机械臂是否沿指定 SE(3) 路径运动、受操作物体是否保持稳定。论文通过对照组验证 PRoPE 几何编码、深度分支、SAM3 + V-JEPA 物体一致性、以及蒸馏模块的贡献。
关键发现
- 直接将 SE(3) 变换注入注意力(PRoPE 风格)能显著提高双臂动作的几何一致性,避免“看似合理但运动错误”的预测。
- 轻量深度分支改善场景级 3D 结构估计,减少背景与遮挡区域的几何失真。
- 使用 SAM3 掩码和冻结 V-JEPA 教师对受操纵物体进行一致性监督,有效抑制抓取过程中物体漂移或消失。
- 分布匹配蒸馏将多步生成器压缩至少数步学生模型,实现高效部署,且在挑战赛排名上保持竞争力。
与基线对比解读
相比仅依赖大规模视频生成先验的基线模型,DreamX-Phi 的改进集中在显式注入动作几何与物理一致性监督,而非单纯增大模型或数据。PRoPE 几何编码让模型对每只手臂的运动具有可辨识的约束,深度和物体掩码进一步锚定场景结构;这类结构化控制通常能降低 rollout 中的累积误差。蒸馏步骤展示了在保持排名前提下压缩推理成本的可行路径,但论文未披露具体加速比或精度损失,需后续代码与权重发布后验证。
行业影响
落地场景
DreamX-Phi 可直接用于机器人操作仿真、规划与合成数据生成。典型场景包括物流仓储的抓取分拣、制造业的精密装配、以及服务机器人的物体操作。模型接收当前帧、语言指令和动作序列,预测未来视频帧与深度,可作为离线“想象引擎”或训练数据生成器接入机器人开发流程。
商业价值
- 降本:显著减少物理试错和真实环境数据采集成本,尤其在多臂协同和易损物体操作中,避免硬件磨损与物料浪费。
- 增效:加速策略迭代,在仿真中快速筛选候选动作序列,缩短从任务定义到部署的周期。
- 体验提升:为数字孪生系统提供高保真、可交互的未来状态预览,便于调试与演示。
与现有产品/工作流的接口
- 作为世界模型插件嵌入 Isaac Sim / PyBullet 等仿真环境,或通过 ROS 节点接收动作并返回预测帧。
- 蒸馏后的 few-step student 可部署到边缘设备,用于实时规划。
- 与现有视频生成模型相比,其 SE(3) 几何控制和 SAM3+V-JEPA 的物体一致性监督,解决了“画面逼真但动作不忠实”的问题,使输出可直接用于下游策略训练。
具体落地 use case:
- 电商仓库拣选机器人:订单到达后,系统用 DreamX-Phi 预测不同抓取路径的未来帧,淘汰可能导致物体滑落或碰撞的方案,再将最优动作序列发送给真实机械臂执行。
- 制造业装配线:针对精密零件插入任务,利用该模型验证动作序列对物体位姿的影响,并在数字孪生中回放预测结果,辅助工程师调试控制参数。
局限
- - **多模块依赖与域迁移风险**:模型依赖外部冻结的 `SAM3` 与 `V-JEPA`,以及额外的深度分支,带来较高的部署复杂度;这些预训练组件在未见环境或新物体上可能出现域偏移,且冻结策略使其无法自适应提升。同时,少步蒸馏虽提升推理效率,但论文未系统量化多步生成质量的下降幅度,可能损害长程 rollout 的物理一致性。
- - **动作空间与真实场景局限**:当前动作仅为末端执行器位姿与夹爪状态,缺少关节空间、力/力矩等控制维度,难以建模接触丰富的精细操作或柔性物体交互。评估仅基于 `WorldArena 2.0/1.0` 基准,未在真实机械臂或更多样化场景下验证;深度分支作为轻量设计,对遮挡、透明或细小物体的几何一致性可能不足。
- - **与端到端自监督方法相比的扩展性弱点**:与 `UniSim`、`Genie` 等从大规模无标注视频中学习动作无关动态的模型相比,本工作引入 `SAM3 mask` 和 `V-JEPA` 对齐作为显式监督,对数据标注或预训练组件要求更高,不易扩展到海量未标注机器人数据;其 `PRoPE` 风格几何编码虽有效,但仍是既有位置编码的适配而非全新架构,整体贡献偏向工程集成。