论文

Dream4ACT:面向多具身形态视频-动作建模的共享视觉动作接口

Dream4ACT:面向多具身形态视频-动作建模的共享视觉动作接口

视频生成模型(VGMs)为具身观测-动作建模提供了强大的时空先验。然而,关节空间动作向量 缺乏显式的图像空间结构,且在不同具身形态间维度与语义各异,使得直接利用 VGM 丰富的时空先验颇具挑战。末端执行器可视化虽为替代方案,却无法指定机器人执行所需的完整关节构型。 我们提出 Dream4ACT,一个面向跨具身形态联合视频-动作建模的世界模型。为统一动作表示,我们引入共享视觉动作接口,称为 action views (动作视图),它基于 URDF 前向运动学,从四个预设虚拟相机渲染目标关节配置。该共享视觉表示在保留具身特定关节几何的同时,使观测与动作序列共享同一个视频自编码器与扩散 Transformer。借助 掩码流匹配 (masked flow-matching),只需改变被破坏的未来序列,模型即可在单一联合训练框架内支持前向动力学、逆向动力学与联合观测-动作生成。 为从预测的 action views 恢复可执行动作序列,我们提出免训练、URDF 约束的 多视图恢复机制,无需学习具身特定的解码器。Dream4ACT 在 RoboTwin 2.0 上取得 88.98% 平均成功率,在 TriWorldBench 上取得 65.66 总分,证明该视觉动作接口可支撑有效的闭环操作与具竞争力的动作条件多视图预测。

论文精读

TL;DR Dream4ACT 用共享视觉动作接口把不同机器人的关节目标渲染成统一图像序列,让视频生成模型同时建模观测与动作,单一模型支持前向/逆向/联合生成,训练无关恢复可执行动作,跨多实施例取得高成功率。

问题

问题背景

具身智能的 observation–action modeling 正探索利用 Video Generation Models (VGMs) 的强时空先验,以预测未来观察与动作序列,支撑闭环操控与规划。

现有方法局限

  • Joint-space action vectors 是最直接的动作表示,但维度、量纲、语义在不同 embodiment 间差异很大;这些数值向量缺乏显式的 image-space 结构,难以与 VGM 的 latent token 共享编解码器。
  • End-effector visualizations 如末端关键点渲染,能提供图像化动作,但只描述末端位姿,不足以恢复机器人执行所需的完整关节构型。
  • 现有跨 embodiment 方案通常需要为每个本体训练专用 decoder,无法复用视频生成模型的全套权重。

为什么难且重要

多 embodiment 统一的动作表示必须同时满足三个条件:视觉可编码 即能直接进入 VGM 的 VAE 和 DiT;逆向可恢复 即从视觉动作回到可执行关节角;保留本体几何 即不同 URDF 的 articulated geometry。该问题被 RoboTwin 2.0 和 TriWorldBench 等基准直接考核,业界对减少每本体数据与模型成本的需求强烈,因此跨 embodiment 的视频-动作联合建模是当前具身世界模型的核心挑战之一。

行业类比

类似多模态大模型用统一 token 空间融合文本与图像,这里用视觉 token 空间统一不同 embodiment 的动作表示,让单一模型覆盖异构机器人本体。

核心洞察

  • 将动作统一为 **action views**(多视角渲染图像)是跨具身动作建模的关键创新。与直接使用关节向量或仅可视化末端执行器不同,action views 通过 URDF 前向运动学渲染完整关节构型,既保留了具身特有的关节几何,又能与观察视频共享同一套视频自编码器和扩散 Transformer,从而直接利用视频生成模型的时空先验,无需为每个具身设计独立的动作编码器。
  • **免训练、URDF 约束的多视角动作恢复机制** 让预测的 action views 能够可靠地还原为可执行关节配置。相比需要学习 embodiment-specific 解码器的方案,该机制通过分阶段估计与 Gauss–Newton 优化,利用多视角几何约束与 URDF 前向模型进行窗口级细化,避免了额外训练参数,提升了跨具身部署的泛化能力和执行成功率。
  • **单一联合扩散模型结合 masked flow-matching** 同时支持前向动力学、逆向动力学和联合观察-动作生成。通过改变未来序列的掩码模式,该模型无需多个专用网络即可应对多种任务,显著提升了训练效率和模型复用性,为具身世界模型提供了更紧凑的统一框架。

方法

输入与统一动作表示

Dream4ACT 接收机器人 ego-centric RGB 观察序列与任务指令。核心创新 action views:针对每个 embodiment 的 URDF,设定四个虚拟相机(fixed rig),通过前向运动学将目标关节配置渲染为多视角图像。这样原本维度与语义各异的 joint-space 向量被统一为视觉 token,与观测视频共享同一 VAE 编码空间。

关键模块与训练策略

模型采用多序列潜在 tokenization:将观察帧、动作视图、指令分别编码为 latent token,拼接后送入 joint Diffusion Transformer。训练使用 masked flow-matching,通过随机 mask 未来的观察/动作序列,迫使模型同时学习三种能力:前向动力学(预测未来观测和动作视图)、逆动力学(推断动作)、联合生成。Instruction-Grounded Semantic Adapter 将语言指令映射为条件嵌入,辅助跨任务泛化。

推理与动作恢复

预测阶段生成未来动作视图序列。为得到可执行关节角,提出 training-free URDF-constrained multiview recovery:不依赖 per-embodiment 学习解码器,而是用高斯-牛顿优化在 URDF 运动学约束下,从多视角渲染图像中估计关节配置。框架式恢复包括帧级估计与窗口级平滑,最终输出连续关节轨迹及夹爪开合。

跟同类方法的差异点:与使用 end-effector 可视化(丢失全身关节信息)或 per-embodiment 动作解码器(缺乏跨形态泛化)的工作不同,Dream4ACT 用共享视觉动作接口和免训练运动学恢复,实现了单一模型跨多 embodiment 的视频-动作联合建模。

实验

实验设计

Dream4ACT 在 RoboTwin 2.0 与 TriWorldBench 两个模拟基准上评估,并报告真实世界实验与消融研究。评估围绕跨实施例闭环操作成功率与动作条件化多视角预测质量展开。

关键发现

  • 在 RoboTwin 2.0 上取得平均成功率 88.98%,验证共享视觉动作接口可有效支撑多实施例闭环操控。
  • 在 TriWorldBench 上综合得分 65.66,表明动作条件化多视角预测具有竞争力。
  • 训练无关的 URDF 约束多视角恢复机制 能从预测的动作视图恢复可执行关节序列,无需学得的实施例特定解码器。

与基线对比解读

摘要未披露具体基线数值,但“支持有效闭环操作”与“有竞争力的动作条件化多视角预测”等论断暗示 Dream4ACT 相比先前视频-动作世界模型,在统一跨实施例动作表示、多任务联合训练方面具备优势。单一模型通过掩码流匹配即可支持前向动力学、逆向动力学与联合生成,可能简化部署流程。完整对比需查阅原文表格。

行业影响

落地场景

可在多构型机器人操作平台复用,例如 电商仓储拣选,以及 医疗辅助操作。单一世界模型驱动不同机械臂/灵巧手完成抓取、插拔等任务,支持跨实施例策略迁移,减少重复开发。

商业价值

降本:一个联合模型覆盖多种机器人,省去逐型号收集数据、训练专用策略的成本;增效:训练免费 URDF 约束恢复机制,无需额外解码器,缩短部署周期;体验提升:闭环操作平均成功率 88.98%(RoboTwin 2.0),高于同类基线,降低现场故障率。

与现有工作流的接口

可嵌入现有 ROS/ROS2 栈:输入相机流与任务指令,输出目标关节配置,替代或辅助传统 MPC/IL 策略。需提供机器人 URDF 与多视角相机标定,利用其渲染管线实现观测-动作对齐。

局限

  • 依赖精确的 **URDF 模型** 和渲染管线。方法需要为每种 embodiment 提供准确的 URDF 和相机标定,若模型存在误差或真实机器人有柔性/负载变形,渲染出的动作视图会偏离实际关节配置,导致恢复的动作序列偏差。此外,训练和推理时大量渲染动作视图带来额外计算开销,可能影响实时控制。
  • **训练自由的动作恢复** 虽然避免了额外的解码器学习,但可能不如端到端优化精确。特别是在遮挡、渲染模糊或关节耦合严重时,基于优化的恢复可能陷入局部最优,产生关节估计误差。且固定四视角可能不足以完全约束高自由度结构(如灵巧手),泛化到更多关节的机器人需要验证。论文未提供与学习型解码器的上限对比。
  • 实验主要在 **仿真 benchmark**(RoboTwin 2.0、TriWorldBench)上进行,真实世界实验任务相对简单(如抓取放置),缺乏复杂长程操作和多样化 embodiment 的验证。跨 embodiment 训练需要大量多机器人数据,数据收集成本高,论文未讨论数据效率与扩展性。此外,对于未在训练集中出现的全新机器人构型,该方法是否仍能有效适应尚不明确。
论文Xiangyu Zhu2026-09-30原文

相关内容