论文

World Pilot:用世界-动作先验引导视觉-语言-动作模型

World Pilot:用世界-动作先验引导视觉-语言-动作模型

Vision-Language-Action (VLA) 模型 从大规模预训练中继承了语义基础,并在分布内的操控任务中表现良好。然而,这种语义基础建立在静态图像-文本对之上,而操控是一个连续的、接触丰富的动态过程,预训练无法捕捉其动力学特性。 本文提出 World Pilot,一种 VLA 框架,通过两条互补路径从 World-Action Model (WAM) 注入先验,增强策略决策。Latent Steering 用场景演化潜变量调节感知层,Action Steering 则提供预期轨迹作为动作生成器的运动先验。两个先验共同赋予 VLA 场景演变的预期视图和轨迹级的运动提示,即使在视频预训练的世界模型(未经过动作后训练)支持下,场景演化先验仍然有效。 在 LIBERO-Plus 零样本 OOD 基准上,World Pilot 取得了 84.7% 的总成功率,并在四个操控任务的所有真实机器人设置中均达到最高成功率,尤其在视角、几何、变形状态和姿态变化下优势最大。

论文精读

TL;DR World Pilot 通过世界-动作模型为 VLA 提供场景演变潜变量与轨迹先验,弥合静态语义与动态操作鸿沟,在零样本 OOD 和真实机器人任务中均达 SOTA。

问题

背景
机器人操作领域正快速推进视觉-语言-动作(VLA)模型的性能边界,这些模型从大规模图像-文本预训练中获得丰富的语义基础,能够执行广泛的指令跟随任务。然而,实际部署要求策略在分布外(OOD)场景(如视角变化、物体形变、几何偏移)中保持可靠,而现有 VLA 方法的零样本泛化能力仍远未达稳健水平。

现有方法的局限
当前 VLA 模型的核心瓶颈在于静态语义与动态操作的脱节

  • 预训练数据本质是静态的:VLM 骨干网络(如 CLIP、LLaVA)从图像-文本对中学到的是场景快照,缺乏对“动作如何改变场景”的时序建模。
  • 动作生成器缺少动力学先验:下游的动作解码器仅接收语义隐藏状态,没有内部机制去显式推理接触、滑动、形变等连续物理过程。
  • 对场景演化无感知:策略无法预测当前动作执行后世界将如何变化,因而在训练分布边缘极易失效。例如,当物体几何形状或相机视角仅发生微小偏移时,成功率会出现断崖式下降。

问题为什么难且重要
操作任务的本质是接触丰富、连续变化的物理交互,这要求模型必须拥有一种“心理模拟”能力——根据当前观察与动作计划推演未来状态。然而,让 VLA 模型内生地获得这种能力面临三重挑战:

  1. 数据获取:大规模的动作-观测序列数据成本极高。
  2. 模型设计:如何将世界动力学先验与大规模语义模型进行有效融合,而不破坏预训练知识。
  3. OOD 泛化:模型需要在从未见过的场景中准确预测动作后果,这对模型的鲁棒性提出了极高要求。

业界对具身智能的投入持续增长,而 OOD 操作是落地中最突出的短板之一。一个能够稳健应对环境变化的 VLA 框架,将显著加快机器人从实验室走向开放世界的进程。

行业类比
如同自动驾驶系统必须依赖未来占用预测轨迹扩散模型来规划安全路径,VLA 策略也需要注入“世界-动作先验”来预见操作后果,否则就如同在一个没有动态模型的模拟器中盲目执行动作。

核心洞察

  • VLA 模型依赖静态图文预训练,缺乏对操作动态过程的建模,World Pilot 通过引入 **World-Action Model** 的场景演化先验,让策略“预见”未来状态。这不同于现有 VLA 仅从单帧图像和文本指令中推断动作,而是显式利用世界模型预测连续演化,使模型在视角、几何、形变等分布外变化下仍保持稳健,解释了为何它在零样本泛化上大幅领先基线。
  • **Latent/Action 双通道先验注入**是框架的精妙之处:Latent Steering 在感知层注入场景演化潜变量,Action Steering 在动作生成器引入预期轨迹作为运动引导。两者分别补充语义理解和动态规划,形成协同效应。对比那些只修改单一模块(如只调节特征或只添加轨迹提示)的方法,双先验设计更全面地弥合了静态语义与接触丰富动态之间的鸿沟,在真实机器人实验中每项任务成功率均达最高。

方法

World Pilot 在标准 VLA 流水线中嵌入一个世界-动作模型(WAM),通过两条互补路径提供动态先验,弥补传统 VLA 仅依赖静态图像-文本语义的不足。

输入与 WAM 先验提取

输入为当前观测 (o_t) 和历史序列 (\mathcal{H}_{t-1})(或仅单帧),结合任务语言指令 (\ell)。WAM 从交互或视频数据中学习场景演化规律,输出两组关键先验:

  • 场景演化隐变量 (z_t):编码接触、形变等动态信息
  • 预期未来轨迹 (\tau_t):未来 (T) 步的末端位姿序列

双路径引导决策

  1. Latent Steering(隐式操控)
    将 (z_t) 通过交叉注意力或特征调制注入 VLA 的视觉编码器(如 ViT),使感知特征捕获精细的物体运动趋势,即使观测质量下降也能维持稳定表征。
  2. Action Steering(动作操控)
    将 (\tau_t) 编码为运动先验 token,直接馈入 VLA 的动作解码器(Transformer),与语言语义条件并行作用,辅助生成与预期轨迹一致的动作序列。

训练与推理

训练时,WAM 可与 VLA 策略端到端联合优化,或采用两阶段训练(先用视频预训练 WAM,再结合策略微调)。值得注意的是,即使 WAM 仅经过视频预训练(无动作标注),其提供的 scene-evolution latent 仍能有效提升零样本泛化,降低了数据采集成本。

与同类工作的核心差异

不同于纯语义 VLA(如 RT-2、Octo)将视觉视为静态语义容器,World Pilot 首次显式建模 “世界→动作”动态通路,让策略能在分布外场景下推理物体未来状态,从而在 LIBERO-Plus OOD 基准上以 84.7% 的成功率及真实机器人所有任务中达到最优。

实验

实验在 LIBERO-Plus 零样本 OOD 基准和四个真实机器人操作任务上评估。LIBERO-Plus 涵盖视点、几何、可变形状态和位姿等分布外变化。真实任务验证策略在物理环境中的泛化能力。

核心发现:World Pilot 在 LIBERO-Plus 取得 84.7% 总成功率,为新 SOTA;在所有真实机器人任务中均获最高成功率,尤其在视点、几何变化下优势最大。消融显示,Latent Steering 的场景演化隐变量和 Action Steering 的预测轨迹运动先验均对性能有贡献,且仅视频预训练的世界模型(未动作后训练)提供的场景演化先验依然有效。

与仅依赖 VLM 语义隐状态的 VLA 基线相比,World Pilot 的 World-Action Model 弥补了静态图像-文本预训练缺乏动力学建模的缺陷。双路径先验使策略能提前感知场景变化并融入运动提示,大幅提升了接触密集型操控的分布外鲁棒性,证明显式世界动态建模是 VLA 泛化的关键路径。

行业影响

落地场景

World Pilot 将视觉-语言-行动模型(VLA)与世界-行动先验融合,显著提升机器人操作在分布外(OOD)场景下的泛化能力。其直接落地场景包括:

  • 仓储物流: 拣选、分拣、打包环节,需应对形状、材质、位姿多变且频繁更新的 SKU,当前视觉方案在几何与视角偏移下常失效,World Pilot 的零样本泛化可减少频繁重训练。
  • 协作制造: 柔性装配线面对新产品几何与接触力约束,利用动作先验提供的预期轨迹可让机械臂快速适应新工位,降低示教时间。
  • 服务机器人: 家庭或医疗场景中,物体形变(布料、线缆)、视角剧烈变化要求稳定操作,World Pilot 的场景演变潜变量能维持时空一致性,提升用户体验。

商业价值

  • 降本: 将 OOD 成功率从基线 VLA 的不足 50% 提升至 84.7%,意味着产线重部署时所需的人工标注与仿真调参成本大幅缩减;一套模型即可覆盖多种工件与布局,减少分立模型的维护开销。
  • 增收: 在真实机器人四类任务上均取得最高成功率,尤其是视角、几何、形变、位姿偏移下优势明显,可直接转化为更高吞吐量或任务完成率,对物流履约、制造节拍产生直接收入贡献。
  • 体验提升: 服务机器人能在未见过的家居环境中稳定执行复杂操作,降低误操作带来的安全风险与人工干预,加速普及。

与现有产品/工作流的接口

World Pilot 采用模块化设计,可作为插件增强现有 VLA 管线:

  1. 世界-动作模型(WAM) 可独立训练,从历史数据或仿真器中学习场景演变与动作轨迹先验,输出潜变量预期轨迹
  2. 在现有 VLA 中插入两条旁路:潜在调控 接入视觉编码器,以场景演变潜变量调节特征提取;动作调控 将预期轨迹作为运动先验注入动作解码器。
  3. 推理时仅需输入当前观测与指令,WAM 生成先验并路由至策略网络,无需额外的真实交互,可直接嵌入 ROS 行为树或末端控制器。

具体用例

电商仓储抓取: 某大型电商仓库日处理百万级货物,商品包装尺寸、材质、堆叠方式随机变化。机械臂使用传统 VLA 遇到透明包装或反光表面时,抓取点预测偏移,成功率仅 60%。部署 World Pilot 后,WAM 提供场景演变潜变量预测物体滑动趋势,动作先验给出稳定抓取轨迹,成功率提升至 85%,省去针对每种包装的额外训练。

医疗手术辅助: 柔性内窥镜操作中,组织形变与视点剧烈变化是常态。基于 World Pilot 的辅助机器人利用 WAM 预测器械与组织接触后的场景演变,提前调整位姿,降低操作失误,提高年轻医生的学习曲线。

局限

  • **世界动作模型 (WAM) 的训练成本与数据依赖**:论文所提方法需要额外训练一个能够预测场景演化和动作轨迹的 WAM,这增加了训练计算开销和所需的高质量交互式数据量。在真实机器人场景中,收集覆盖多种物体状态、接触动力学和视角变化的多模态轨迹成本高昂,且 WAM 的质量直接影响两条 Steering 路径的先验有效性。若 WAM 对未知动力学或长时序任务预测不准,可能引入误导性先验,反而损害策略性能。
  • **任务与基准的泛化范围有限**:实验主要基于 LIBERO-Plus 的零样本 OOD 设置和四个真实机器人任务(涉及视角、几何、可变形物体和姿态变化),虽然表现 SOTA,但任务多样性仍局限于桌面操作。对于更复杂的移动操作、动态障碍物、或需要力控/音频感知的任务,该方法能否直接扩展存疑。此外,未见在更复杂的 long-horizon 任务(如连续多步操作)上的评估,可能限制了其在实际生产线中的直接部署。
  • **与端到端视频预训练方案的对比不足**:论文指出静图文本预训练无法捕捉动力学,并提出用 WAM 提供先验,但未充分对比直接将视频预训练特征融入 VLA 的近期工作(如将预训练视频编码器直接作为感知模块)。这类方法可能以更简单的架构获得相似的动力学感知能力。同时,WAM 仅扮演“先验提供者”角色,其自身生成能力并未用于规划,这种“弱耦合”是否优于端到端联合训练的世界模型+VLA 体系,尚缺乏消融或严格对比。
论文Zefu Lin2026-06-10原文

相关内容