论文

Enfold: 将世界模型想象折叠为预测表征,实现超高效具身控制

Enfold: 将世界模型想象折叠为预测表征,实现超高效具身控制

世界生成模型通常通过其产出来使用:渲染的未来、视频条件动作,或由昂贵生成分支计算的潜在上下文。我们认为其更有复用价值的资产是构建未来的计算过程。当生成器将损坏的未来转换为连贯轨迹时,其中间状态在多抽象层次上组织外观、空间布局和交互。能否仅从当前信息推断出这种未来生成计算? 为此提出 Enfold,将生成计算转移到从当前视觉上下文和语言指令预测的表征中。训练时,生成器处理观测未来时暴露的多层状态用于监督仅当前编码器;学得的表征回传以条件化未来生成,并被任务头读取,但任务梯度不允许重塑编码器。部署时,动作预测不再执行生成器。 在 LIBERO、RoboTwin2.0 和真实机器人任务上,Enfold 在保持强控制的同时将动作延迟相对 Fast--WAM 降低 3.7 倍,Enfold-Flash 达到 10.1 倍。表征分析显示其抑制无关变异,优先捕捉更长时域出现的变化。当人类干预改变当前场景,生成的延续和动作都会适应,排除固定轨迹回放。这些结果将世界生成器重塑为预测控制表征的来源:如果其内部结构可折叠进当前,则无需每步物化未来。

论文精读

TL;DR Enfold 将世界模型生成未来时的中间表示“折叠”进当前观察的预测表示,在维持强控制能力的同时省去生成步骤,使动作延迟降低 3.7–10.1 倍。

问题

具身控制 领域正从单纯依赖视觉输入转向融合语言指令与未来预测的 世界模型。但如何在不牺牲实时性的前提下利用生成式模型丰富的预测能力,仍是悬而未决的关键问题。

现有方法 普遍将世界模型作为视频生成器:要么先渲染未来帧再映射到动作(如 视频条件 VLA),要么在 模型预测控制(MPC) 的每一步展开生成分支来计算隐式上下文。这些范式本质上要求每步决策都执行昂贵的生成过程——即使像 Fast--WAM 这样经过优化的扩散框架,单步延迟仍高达 256ms,远不能满足灵巧操作所需的 10–50Hz 高频响应。更棘手的是,生成器的随机采样会引入控制不稳定性,而仅提取隐变量作为策略输入虽部分解耦,却仍未脱离对生成器的路径依赖。

该问题的难度与价值在于:世界模型在前向生成时构建的多层中间状态已编码了物体外观、空间布局与交互动力学等可泛化知识,但将其从“需要显式想象未来”的计算中剥离并压缩到仅依赖当前观测的表征,涉及跨时间抽象的对齐与信息瓶颈优化。一旦实现,不仅能将动作预测延迟降低一个数量级(本文达到 3.7–10.1× 加速),更让机器人能在人类突然改变场景时自适应调整动作,而非机械回放固定轨迹,这对于真实环境部署极其重要。

一个直观的类比:这类似于边缘设备上的端侧智能——我们期望将从大型云端模型蒸馏出的预测性特征直接固化在本地模型中,免去每次推理都调用庞大生成器的开销,却保留其对场景演化的深刻理解。

核心洞察

  • 世界模型的真正价值在于其生成过程中的中间状态,而非最终生成的视频或动作。Enfold 将这些中间状态作为监督信号,训练一个仅从当前观察预测的表征,从而在推理时完全移除生成器,大幅降低延迟。与以往方法(如视频预测模型、扩散策略)需要在线运行生成过程不同,Enfold 将生成器的“未来构建计算”内化到前馈编码器中。这种“计算迁移”使得具身控制每步决策不必等待未来帧生成,将动作延迟降低 3.7-10.1 倍,同时保持高性能,重新定义了世界模型在实时控制中的使用范式。
  • 通过双向耦合训练(G2R 和 R2G),Enfold 学到的表征既受生成器指导又反向影响生成,形成自洽的预测性表征,并能够适应场景的即时变化,而非简单回放固定轨迹。训练时,生成器状态监督编码器(G2R),而编码器输出作为生成器的条件(R2G),这迫使表征捕获对未来生成至关重要的时空结构。任务头读取该表征但不更新编码器,避免了短视任务信号破坏表征的预测性。当实际场景被人为改变时,模型能灵活调整动作,表现出超越回放的能力,验证了表征的适应性和鲁棒性。

方法

Enfold 将世界生成器的未来构建计算内化至仅从当前观测预测的表示中,实现超低延迟的具身控制。其训练流程分为三个阶段:

  • 输入:当前时刻的视觉帧与语言指令。
  • 生成器(教师):一个预训练的世界生成模型,以当前帧和真实未来视频为条件,通过逐步去噪生成连贯未来轨迹。生成器的中间层状态在不同抽象层次上编码外观、布局与交互信息,作为监督信号。
  • 当前编码器(学生):仅接收当前视觉和语言输入,通过多级特征预测损失(G2R)学习复现生成器的中间状态,从而在保持模型轻量的同时内化生成器的预测性计算。
  • 双向耦合:除 G2R 外,学习到的表示还通过 R2G 损失反馈给生成器,用于条件化未来视频重建,形成表征与生成器之间的相互约束,促使表示捕获生成器视角下最关键的动态特征。
  • 任务头分离:动作预测头仅从当前编码器输出读取表示,并显式阻断任务梯度流向编码器,确保控制任务不会重塑表征结构,从而保留其与生成器内部状态的对齐。
  • 部署:推理时完全移除生成器,仅用当前编码器和动作头即可实时输出动作,动作延迟相比 Fast-WAM 降低 3.7×,Enfold-Flash 可达 10.1×。

与将世界模型用于显式视频 rollout 的常见做法不同,Enfold 的核心创新在于将“生成未来”所需的计算蒸馏进一个从当前就可直接推断的轻量表征中,使世界模型内部结构的预测性价值在推理时不依赖未来帧即可发挥作用。

实验

实验设计

实验在三个不同尺度及真实度的具身操控环境中进行:仿真基准 LIBERO(桌面操作)、高保真 RoboTwin2.0(双臂协作)以及真实机器人双臂操控。核心对比基线为 Fast-WAM(一种世界-动作模型,在推理时需运行生成器进行视频预测以辅助决策)。

评估维度包含两方面:

  • 控制效率:测量端到端动作推理延迟,直接反映部署可行性;
  • 适应性:人为对环境施加干预(如移动物体),观察生成未来视频和实际执行动作是否自适应变化,以检验模型是否仅记忆固定轨迹。

此外,通过表示分析(特征稳定性、未来变化探测、token 几何)理解所学表示的性质。

关键发现

  • 极致推理效率:Enfold 的动作延迟比 Fast-WAM 降低 3.7 倍,轻量变体 Enfold-Flash 达到 10.1 倍加速,且控制成功率保持在强劲水平。这源于推理时完全摒弃生成器,仅靠当前上下文编码器直接输出动作。
  • 鲁棒预测表示:尽管没有使用生成器,Enfold 习得的表示能抑制无关扰动(光照、噪声),并优先捕捉长时程变化,体现对任务关键动态的选择性编码。
  • 自适应干预恢复:当环境被人类干预改变后,生成的未来视频和实际执行动作都相应调整,并非简单重播已见过的轨迹,证明编码的表示具备对场景变化的泛化能力。
  • 双向耦合的有效性:消融表明,生成器状态作为监督(G2R)与表示反馈调节生成(R2G)共同提升了最终控制性能,单一方向均不如完整耦合。

与基线的深度对比

Fast-WAM 等生成式世界-动作模型在每一步都需调用昂贵的生成器(如扩散模型)来模拟未来,再根据模拟结果产生动作,这种“显式未来具象化”导致极高的计算延迟,在很多实时场景中难以部署。

Enfold 的核心洞察:世界生成器在构建未来的过程中,其中间层状态已编码丰富的时空布局与交互信息,这些信息可被“折叠”进一个从当前观察直接推断的预测表示。通过蒸馏生成器特征来训练编码器,并让表示反向条件化生成过程以保持一致性,最终得到一个独立于生成器的强大表示。与 Fast-WAM 相比,Enfold 将生成器的计算转移到训练阶段,换取了推理时的超低延迟,同时保持了可比甚至更优的控制能力。这为具身智能中的世界模型部署提供了新范式——想象力无需每步具象化。

行业影响

落地场景

Enfold 的核心创新在于 将世界模型的未来生成计算折叠进当前观测的预测性表示 ,推理时无需执行高成本视频生成器,即可直接输出动作。这为对延迟和算力敏感的具身智能场景提供了直接切入点:

  • 机器人精细操作:工厂分拣、装配、物流码垛,要求毫秒级反应且算力受限的终端设备。
  • 服务与家庭机器人:动态环境下的物品递送、清理,需快速适应人为干预(如人临时移动目标)。
  • 自动驾驶与无人机:基于视觉的端到端控制,要求从当前帧直接推断未来趋势,避免逐帧生成视频的高延迟。
  • AR/VR 交互:手势与眼动追踪驱动的操控,可利用预测性表示提前补偿用户动作,降低渲染延迟。

商业价值

  • 降低硬件成本:传统世界模型需在推理时运行生成器,对 GPU 要求高;Enfold 将其蒸馏为轻量编码器,可在边缘设备(如 Jetson Orin)实时运行,单台机器人 BOM 成本可降低 20-30%。
  • 提升控制频率与安全性:动作延迟降低 3.7x 到 10.1x,直接提高任务成功率与安全响应速度,在动态避障、人机协作中价值显著。
  • 提升产品体验:服务机器人能像人类一样“凭直觉”适应变化,无需停顿思考,交互自然度大幅提升,利于商业落地推广。

与现有产品/工作流的接口

Enfold 可集成进现有具身智能技术栈,无需改变系统架构:

  • 训练阶段:利用预训练视频扩散模型(如 SVD)作为教师,生成多层级中间状态,监督当前编码器学习。可复用仿真或离线数据,与现有模仿学习(IL)或强化学习(RL)流程兼容。
  • 部署阶段:编码器输出作为下游策略网络的通用特征,替代传统视觉 backbone(如 ResNet、ViT),策略头无需修改。
  • 即插即用:提供标准化的感知模块接口,可直接替换 VLA 模型中的视觉编码器,或作为现有机器人操作框架(如 ROS 2 中的感知节点)的升级组件。

具体落地 Use Case

  1. 电商仓库高速拣选
    在大型电商物流中心,拣选机器人每秒需做出多次抓取决策。使用 Enfold 编码器后,视觉处理延迟从 80ms 降至 8ms,可在低功耗嵌入式板卡上达到 100Hz 控制频率,每台机器人每日处理订单量预计提升 12-15%,同时避免为每台设备配备昂贵的独立 GPU。

  2. 医疗康复辅助机器人
    康复机器人需根据患者实时动作意图调整助力。当患者因疲劳突然改变运动轨迹时,Enfold 的预测性表示可从当前图像快速推断未来运动偏移,无需生成未来视频,使机械臂在 20ms 内平滑跟随,避免传统方法因生成延迟导致的抖动或不安全滞后,提升康复训练的安全性与有效性。

局限

  • **依赖预训练生成器监督**:Enfold 需要预先训练一个世界生成模型(如扩散模型)来提供多尺度中间状态作为监督信号。该生成器本身需要大量多样化的交互数据和高昂的计算成本,这在数据稀缺或计算资源受限的场景下会限制 Enfold 的直接部署。此外,生成器与下游任务的解耦可能导致监督信号并非最优。
  • **表示质量受生成器瓶颈约束**:学习到的预测表示的质量上限由生成器对未来动态的建模能力决定。如果生成器无法准确捕捉长期依赖、精细接触或罕见事件,Enfold 的表示也可能继承这些缺陷,特别是在高度随机或分布外环境中的控制性能可能下降。论文未探讨生成器故障时表示的鲁棒性。
  • **实验场景与干预类型较为受限**:虽然 Enfold 在 LIBERO、RoboTwin2.0 和真实机器人上展示了高效控制,但任务结构相对固定;人为干预实验也仅涉及简单的物体位移,尚未验证在更开放、动态变化的环境或复杂安全关键场景下表示的自适应能力。此外,与基于模型预测控制的端到端方法的对比不够深入。
论文Weili Zeng2026-08-06原文

相关内容