论文

iMac: 将动作转化为运动和接触图像用于具身世界模型

iMac: 将动作转化为运动和接触图像用于具身世界模型

具身世界模型已成为视觉机器人决策和交互环境模拟的关键范式。然而,传统具身框架依赖于低维结构化的动作向量(如关节角度和末端执行器位姿),存在表达力有限、跨不同具身体泛化能力差、以及对复杂物理交互的动态建模不自然等问题。 为解决这些局限,本文提出 iMac (Image as Action Control),一种新颖的统一控制范式,将原始视觉图像作为具身世界模型的原生动作表示。与传统显式运动学动作编码不同,iMac 将连续视觉操作视为基于图像的动作令牌,这些令牌内在地包含了空间运动意图、交互几何约束和细微物理动态。我们构建了由图像动作编码器和动态世界预测器组成的双分支具身架构:编码器将目标驱动的视觉图像压缩为紧凑的动作嵌入;预测器学习以图像动作为条件的环境转移规则,实现高保真未来状态预测和闭环具身控制。 在公开的具身操作基准和真实机器人场景上的大量实验表明,iMac 在预测精度、任务成功率和跨场景泛化能力方面均优于基于向量的动作控制基线。此外,我们的图像动作设计消除了对人工定义动作空间的依赖,实现了对异构具身智能体的灵活通用控制。这项工作为具身世界模型提供了创新的视觉-动作视角,为可扩展的机器人感知和操作提供了一种简单而有效的范式。

论文精读

TL;DR iMaC 将机器人动作渲染为运动与接触图像,作为空间显式的控制输入,让世界模型能精准捕捉厘米级动作的物理后果,并可靠评估跨场景策略性能。

问题

具身世界模型(embodied world models)已成为视觉机器人决策与交互仿真的核心范式,其关键能力在于根据机器人动作条件化地预测未来视频。然而,当前主流方法将动作编码为低维结构化向量(如关节角度、末端执行器位姿),再通过 Adapter 或 FiLM 层注入视频生成模型。这种隐式表征存在三大局限:

  1. 空间信息损失严重:紧凑向量难以传达厘米级精度的机器人位形变化及与场景的几何交互(如抓取接触、遮挡关系),模型被迫从有限标注中猜测复杂空间后果。
  2. 跨形态泛化能力弱:不同机器人的动作空间维度、语义差异巨大,针对特定形态设计的向量动作编码无法迁移到异构机器人。
  3. 物理动态建模失真:间接条件化导致生成的视频在接触点附近常出现穿透、滑动等违背物理的伪影,难以支撑可靠的任务成功率评估。

原论文指出:“centimeter-level action differences can determine contact, object motion, and task outcome”,而向量控制抽象化正是该瓶颈的根源。

问题的难度与重要性在于,具身世界模型需同时捕捉机器人自身视觉变化(如关节运动轨迹)和机器人与场景的空间关系(如工具-物体接触面)。这要求动作表示本身具备显式的空间与几何先验,而非依赖模型从隐式编码中学习。业界对此高度关注,因为能否精准预测交互结果是世界模型用于策略评估和闭环训练的前提,直接关系到具身智能从仿真走向真实世界的可行性。

行业类比:如同自动驾驶从手工定义特征演进到用原始传感器数据端到端预测规划,iMaC 将离散动作向量替换为原生图像控制信号,本质上是一场从“指令符号”到“视觉直觉”的范式迁移,为通用机器人操控提供了更丰富、更自然的 action space。

核心洞察

  • 动作表示从抽象向量到空间显式图像的范式转变:传统的具身世界模型将机器人动作压缩为低维向量(如关节角度、末端位姿),模型需隐式推断动作的空间后果,导致厘米级操控精度不足。iMaC 首次将动作渲染为运动图像和接触图像,将空间意图、几何约束和交互动态直接编码进像素空间,使条件信号与视觉观测同构,大幅降低了世界模型对空间关系的推理难度,从根源上提升了预测精度和跨场景泛化能力。
  • 接触图像显式建模机器人-场景几何交互:现有方法通常依赖深度预测或点云重建作为辅助任务,但未直接为世界模型提供交互先验。iMaC 利用当前场景与未来机器人构型渲染的接触图像,在像素级提示哪些区域即将发生接触与受力,本质上是将物理仿真中的碰撞检测前移为视觉条件。这一设计让世界模型无需从零学习接触动力学,特别适合长时序、多物体交互的操控任务,解释了其在真实机器人实验中相对于向量基线的显著性能增益。

方法

输入与整体思路

iMaC 将传统的低维结构化行动向量(关节角度、末端位姿)替换为图像形式的控制信号,以更直接地传递空间信息。输入包括:当前环境观测图像、未来行动序列、机器人 URDF 模型。核心思想是:将行动"翻译"为运动图像和接触图像,让世界模型像处理视觉输入一样感知动作意图。

关键模块

1. 运动图像生成

利用机器人 URDF 和前向运动学,将未来关节动作渲染为未来机器人观测的控制视频。这些"运动图像"显式描绘了机器人在未来时刻的外观,使模型无需从抽象向量中隐式推断机器人姿态。

2. 接触图像生成
  • 预测当前观测的深度图作为辅助信号,构建 3D 点云。
  • 结合未来机器人姿态,计算几何控制分支
    • 空间占位接触:体素化表示机器人与场景的相对位置。
    • 投影接触:将 3D 交互映射回 2D 图像平面,形成接触图像。
  • 这两类控制信号分别刻画了"未来机器人自身样貌"和"机器人-场景空间关系",共同驱动环境动态。
3. 双分支架构
  • 图像-行动编码器:将目标驱动的视觉图像压缩为紧凑的行动嵌入。
  • 动态世界预测器:接收当前观测与图像化行动控制,学习环境过渡规则,输出未来视频帧
    • 训练时采用分块 rollout 策略:将长时域视频切分为多个短片段,每个片段由上一片段最后一帧作为初始状态,避免直接预测长序列时的误差累积(曝光偏差),支撑分钟级生成。

输出与闭环控制

模型输出未来状态的视频预测,可直接用于闭环策略评估:给定策略生成的未来行动,iMaC 预测相应的视觉结果,从而判断任务成功率,无需在真实环境中执行。

与同类方法的差异

与 Unipi、Susie 等基于向量行动的具身世界模型相比,iMaC 用图像替代向量作为行动表征,避免了对行动空间的手工定义和行动语义的压缩瓶颈,能天然捕获厘米级空间交互细节,并在异构机器人间提供更好的泛化性。

实验

实验设计

iMaC 在8 个长程真实机器人操作任务(如任务 1–8 所示)上评估,覆盖多种复杂操控场景。核心思路是将未来关节动作转化为运动图像(motion images,通过 URDF 和正向运动学渲染)和接触图像(contact images,基于深度预测和 3D 点云构建),作为显式空间控制信号注入视频生成模型。训练时采用训练时 rollout 策略,支持分钟级长视频生成,并缓解生成块间的曝光偏差。评估指标聚焦预测准确性任务成功率跨场景泛化能力,同时检验世界模型对策略相对性能的评估可靠性。

关键发现

  1. 图像动作控制成功编码了厘米级关键的空间交互信息,使模型能够精确预测机器人与物体的动态。
  2. iMaC 的世界模型成功估计与真实世界策略性能呈强正相关,可作为策略评估的模拟器。
  3. 通过移除对手工定义动作空间的依赖,iMaC 对异构具身智能体表现出更统一、更灵活的操控能力。
  4. 训练时 rollout 有效提升了长时域生成的一致性和鲁棒性,曝光偏差显著降低。

与基线的深度对比

传统方法(如基于向量的动作条件模型)将未来动作压缩为低维向量,依赖学习到的调节模块间接推断空间后果,难以捕捉细微的几何联系和接触动态。相比之下,iMaC 直接将动作转化为与观测同模态的图像控制:

  • 预测准确度:iMaC 在视频帧重建和状态预测上均优于向量基线,得益于运动图像提供的机器人外观先验和接触图像编码的物体间空间关系。
  • 任务成功率:在真实机器人评测中,iMaC 实现的成功率提升源于更精确的接触判断和物体运动建模,避免了向量抽象导致的偏差。
  • 泛化性:图像动作 token 天然跨越不同机器人形态和场景,无需为每个机器人重新定义动作空间,而向量基线在更换机器人时需要重新设计动作表征。

iMaC 提供了一种简洁有效的视觉动作范式,尤其适用于需要细粒度空间理解和长程规划的具身 AI 任务。

行业影响

落地场景

iMaC 提出的图像动作控制 范式,使具身世界模型能够直接以原始视觉图像作为动作表示,预测未来视频并评估策略。这为依赖高保真仿真的工业应用开辟了新空间:

  • 机器人操作策略评估与选型:在仓储物流分拣、精密装配等场景,可利用 iMaC 在真实部署前对候选策略进行分钟级长程 rollout 评估,筛选出成功率最高的模型,减少真机试错成本。
  • 数字孪生与交互仿真:制造业数字孪生系统可集成 iMaC,根据规划的动作序列生成逼真的未来状态视频,用于产线节拍优化、人机协作安全验证。
  • 数据驱动闭环训练:自动驾驶或服务机器人领域,可将 iMaC 作为“想象引擎”,根据想象的动作生成多样化的环境交互视频,扩充训练数据。

商业价值

iMaC 的商业价值集中在降低真机测试开销加速策略迭代

  • 降本:通过高精度世界模型离线评估,显著减少物理机器人实验次数与硬件磨损,据论文在 8 项长程任务上的结果,iMaC 对策略相对性能的评估与真实表现强正相关,意味着可以替代大量昂贵的真机测试。
  • 增效:其训练时 rollout 策略 支持分钟级长时间视频生成,摆脱了传统世界模型仅能预测数秒的局限,使得复杂长程任务的策略验证周期从数天缩短至数小时。
  • 体验提升:在服务机器人产品中,这一能力可赋能远程监控系统,为操作员提供未来动作的视觉预览,提升遥操作安全感与效率。

与现有产品/工作流的接口

iMaC 作为动作条件视频生成模型,可平滑嵌入现有机器人学习栈:

  • 输入要求为未来关节动作序列 + 当前场景观测(RGB 或 RGB-D),输出为未来帧视频与点云,这完全兼容常见的 URDF 运动学模型forward kinematics 管线,无需额外标定。
  • 可与主流策略训练框架(如模仿学习、强化学习)集成:训练阶段使用 iMaC 为策略提供想象 rollout 以辅助 critic 学习;评估阶段利用生成视频计算任务成功指标。
  • 模型结构上,iMaC 的双分支架构(图像动作编码器 + 动态世界预测器)可被封装为可回调的服务模块,通过 REST API 或 gRPC 接入现有云仿真平台,与 ROS 2 生态无缝对接。

具体落地案例

1. 电商仓库拣选系统优化

某大型电商的自动化仓库中,异构抓取机器人需处理千万级 SKU。使用 iMaC 对多种抓取策略进行离线世界模型评估,仅需少量真机测试就能筛选出针对新品类的最佳策略,避免因频繁试错导致的订单延误和货物损坏。集成方式:将 iMaC 嵌入仓库数字孪生平台,策略控制器输出候选动作序列,iMaC 实时生成操作过程视频,系统根据最终画面判断是否成功抓取目标物体。

2. 手术机器人培训与术式规划

手术机器人培训系统可利用 iMaC,根据术者规划的器械动作序列,生成高保真组织交互视频,让学员预习操作后果。对于新术式开发,外科医生可调整动作参数,通过 iMaC 快速预览组织形变与缝合效果,降低尸体或动物实验频率。集成方式:将 iMaC 作为仿真后端,接收达芬奇等手术机器人的关节角度流,渲染出内窥镜视角的预测画面,叠加到导航界面。

局限

  • **依赖机器人运动学模型与标定**:iMaC 需借助准确的 **URDF** 与前向运动学生成运动图像,并依赖深度预测构建接触图像,实际部署中若标定不准或深度估计有偏,会直接污染控制信号,降低世界模型预测保真度。这限制了其在无模型或标定缺失场景下的即插即用能力。
  • **长时 roll-out 误差累积**:虽然训练时 rollout 策略缓解了曝光偏差,但自回归生成超过分钟级的长视频仍会逐步漂移,尤其在物理接触频繁的任务中,微小偏差经多步放大后可能导致状态崩溃。目前仅在 8 个固定任务上评估,对动态变化更剧烈的日常操作是否鲁棒尚不明确。
  • **与纯视觉动作表示的对比不足**:论文主要与向量动作基线比较,未对比其他基于图像的显式动作控制方法(如基于关键点轨迹或光流的条件生成),因此难以量化 iMaC 相对于同类视觉控制范式的独特增益,尤其在仅依赖 RGB 输入时,渲染管道带来的额外计算开销是否必要仍有待论证。
论文Zhenyu Wu2026-06-08原文

相关内容