论文

DyPES-VLA: 跨实体操控中学习共享动力学先验与实体特定控制

DyPES-VLA: 跨实体操控中学习共享动力学先验与实体特定控制

Vision-Language-Action (VLA) 模型已成为机器人操控的强大范式,但为异构机器人实体训练单一通用策略仍是一个开放问题。现有方法存在两个主要局限:第一,未能充分利用跨不同视觉与交互数据中共享的动力学先验,限制了跨实体迁移;第二,需要大量手动预处理将实体特定动作转换为统一格式。 为解决这些问题,我们提出 DyPES-VLA,一个跨实体 VLA 模型,同时学习共享动力学先验与实体特定控制。首先,通过在跨实体数据上以未来预测目标训练视觉语言模型,驱动共享查询表示捕捉物体运动、接触及交互引起的场景变化,从而学习共享动力学先验。其次,一个实体特定混合专家 (MoE) 动作头直接在每个实体的原生动作空间中将这些共享动力学先验转化为可执行控制,无需手动预对齐异构动作。该动作头共享注意力层以捕捉常见的时间动作结构,同时其实体特定的前馈专家处理不同实体的独特运动学约束与控制语义。 作为通用策略,我们的方法在仿真与真实世界评估中均达到最先进性能:在 LIBERO 上成功率达 98.0%,在 RoboCasa-GR1 上为 59.25%,在 RoboTwin 2.0 上为 89.02%。

论文精读

TL;DR DyPES-VLA 通过未来预测学习跨具身共享动态先验,并用具身特定 MoE 动作头直接输出原生控制,无需手动对齐动作空间,在操控任务上达到 SOTA。

问题

问题背景

视觉-语言-动作(VLA)模型已成为机器人操作的通用范式,但训练一个能同时控制多种异构机器人实体的单一通用策略依然是一个开放难题。

现有方法局限

现有跨实体 VLA 方法存在两个关键制约:

  • 动力学先验未充分利用:不同实体在执行操作时共享大量底层物理规律(如物体运动、接触、场景变化),但现有模型往往只关注动作模仿,未显式从跨实体数据中学习这些共享 dynamics priors,导致跨实体迁移效率低下。
  • 动作空间手工对齐负担重:为统一不同机器人实体的动作,传统流程需要大量人工将实体特有动作转换为统一格式(如统一末端位姿、关节角度等),这不仅繁琐,还易丢失实体本身运动学约束与控制语义,难以扩展到新实体。

核心挑战与重要性

技术挑战:不同机器人实体的动作空间维度、语义和控制模式差异巨大(例如多指手与夹爪、移动基座与固定基座),直接学习统一动作头极易导致互斥与负迁移。而仅通过共享视觉-语言表征难以传递足够的动力学信息,使得模型无法准确预测动作后果。因此,如何在保留实体特殊性的同时最大化共享知识成为关键。

业界关注度:工业界与学术界对通用机器人策略的需求日益迫切——一个能零样本迁移到新实体的模型可大幅降低部署成本、加速开发周期。VLA 的跨实体泛化能力直接决定了其在复杂制造、家庭服务等多元场景中的实用价值。

行业类比

该问题类似于多模态大模型中从单模态到全模态的演进:早期模型为每个模态设计独立编码,后来通过共享骨干与模态适配实现统一理解;跨实体 VLA 能否找到类似的“共享表征 + 实体适配”方案,是机器人基础模型从单机专用走向通用泛化的关键一步。

核心洞察

  • **学习共享动态先验而非静态视觉特征**:DyPES-VLA 通过未来帧预测目标在跨实体数据上训练 VLM,迫使共享查询表示编码物体运动、接触与场景变化等动态信息,而非仅依赖静态的视觉语言对齐。这与多数 VLA 模型直接使用预训练 VLM 特征、未显式建模物理交互动态的范式形成对比,使模型能更本质地理解操作任务中的因果结构,从而在未见实体上表现出更强的迁移能力。实际工程中,这暗示在设计通用操控策略时,应将“预测未来变化”作为核心训练目标,以提取真正与动作相关的共享表示。
  • **实体特异性 MoE 动作头消除了异构动作空间的手动对齐需求**:该方法在共享注意力层中捕获跨实体通用的时序动作结构,而让各实体的路由前馈专家直接在其原生动作空间中输出可执行指令,无需提前将所有动作统一到同一格式。相比 RT-X 等工作需要大量人工预处理将不同形态动作映射到公共空间,DyPES-VLA 大幅降低了工程复杂度与信息损失风险,同时保留了各机器人特有的运动学特性。这一设计为实际开发多实体操纵系统提供了可扩展的架构范式:共享高层推理,而将低层控制保留给领域专家网络,实现通用性与专用性的高效平衡。

方法

输入与共享查询接口

DyPES-VLA 接收多模态输入:视觉图像序列、语言任务指令以及(可选的)embodiment metadata(如具身类型标识符)。这些输入首先被送入一个共享 VLM 骨干,生成统一的shared query representation。该 query 表示作为跨具身的通用接口,承载场景理解与任务意图。与多数 VLA 方法不同,DyPES-VLA 不要求事先将异构机器人的动作空间转为统一格式,而是让 query 捕捉与具体具身无关的环境交互信息。

动力学先验学习(Dynamics Priors)

方法的核心创新之一是未来预测目标。在 Stage 1 预训练阶段,模型仅使用无动作标签的跨具身视频数据,训练 VLM 预测未来的 visual tokens 或潜表示。具体而言,给定当前观察和任务描述,要求模型输出的 shared query 能恢复未来帧的视觉特征(如通过最小化 MSE 或余弦相似度损失)。该目标强制 query 编码物体运动、接触事件、场景变化等共享动力学先验。这些先验对跨具身迁移至关重要,因为无论末端执行器是夹爪还是灵巧手,杯子被打翻的物理规律是共通的。

具身特定动作解码(Embodiment-Specific Control)

第二阶段引入具身特定的 MoE 动作头,它将 shared query 直接映射到各具身的原生动作空间(例如末端位姿、关节角度)。动作头设计上,所有具身共享注意力层,以捕获跨具身通用的动作时序结构(如接近、抓取、释放的阶段性模式);而**前馈专家网络(feed-forward experts)**则通过路由机制,按具身标识选择特定子网络,处理各自独特的运动学约束与控制语义。这样无需将异构动作人工对齐到一个共同格式,极大减少了手工预处理。

两阶段训练

  • Stage 1:利用大规模无动作跨具身视频,冻结动作头,仅训练 VLM 与未来预测头,学习动力学先验。
  • Stage 2:在带动作标签的跨具身演示数据上,联合微调整个模型(包括 MoE 动作头),使 shared query 适配控制任务,同时利用先验提升样本效率。

与同类方法的差异:与 OCTO、OpenVLA 等需要预先将各机器人动作归一化到统一空间(如绝对 Cartesian 或 joint-space 标准值)不同,DyPES-VLA 通过未来预测从视频中习得可迁移的物理动态,并使用 MoE 原生输出动作,避免了繁琐的格式对齐和手工设计,实现了更灵活的跨具身泛化。

实验

实验设计

在两阶段训练框架下,先在无动作的跨 embodiment 视频上预训练 VLM 预测未来帧以学习共享动态先验;再在带动作标签的跨 embodiment 演示上联合微调,加入 embodiment 特定的 MoE 动作头。评估覆盖仿真强基 LIBERO(长期操控)、RoboCasa-GR1(家庭场景)和 RoboTwin 2.0(双臂移动操作),并与 RT-2-X、Octo、OpenVLA 等 SOTA 跨 embodiment VLA 比较。消融实验针对未来预测目标、MoE 设计和 embodiment 元数据的作用,并通过未来接触探针分析表征质量。

关键发现

DyPES-VLA 在所有基准上取得最佳性能:LIBERO 达 98.0%、RoboCasa-GR1 达 59.25%、RoboTwin 2.0 达 89.02%。共享动态先验有效捕获物体移动、接触及交互带来的场景变化,推动跨 embodiment 迁移。Embodiment 特定 MoE 头在保留原生动作空间的条件下生成可执行控制,免去费时的动作空间手工对齐。真实世界部署亦验证了强泛化能力。

与基线对比解读

传统方案(如 Octo、OpenVLA)多采用统一动作空间(如相对末端位姿),牺牲各 embodiment 的独特运动学特性,且无法利用海量无动作视频。DyPES-VLA 通过未来预测从视频中提取通用动态先验,结合共享注意力层与 embodiment 专属前馈专家,既捕获跨 robot 的时序动作共性,又保留各自的关节约束与控制语义。消融显示,移除未来预测目标导致成功率骤降,说明动态先验是跨形态迁移的关键;而简化 MoE 为共享全连接层同样损害性能,证实 embodiment 特定设计的重要性。该方法为异构机器人统一操控策略提供了新的工程路径:无需设计复杂动作界面对齐,即可实现高效多形态协同训练。

行业影响

落地场景

DyPES-VLA 通过共享动态先验与具身特定控制,使单一策略直接适配异构机器人实体,无需手动对齐动作空间。这使它在仓储物流、柔性制造、家庭服务等需要多种机器人协作的场景中快速落地。例如,电商仓库中,不同型号的AMR(自主移动机器人)、机械臂和移动操作平台可共用一套 VLA 策略,执行分拣、搬运、打包等任务,减少为每种硬件单独训练模型的成本。

商业价值

  • 降本:消除异构动作空间的手工预处理,显著降低跨平台部署的工程投入;共享 VLM 骨干减少训练数据和计算资源需求。
  • 增效:同一策略在LIBERO(98.0%)、RoboCasa(59.25%)、RoboTwin 2.0(89.02%) 上均达到SOTA,跨具身泛化能力强,加快多机器人产线集成速度。
  • 体验提升:原生动作空间控制减少动作转换误差,提升操作精度,降低碰撞与故障率,提高整体系统可靠性。

与现有产品/工作流的集成

该模型可作为即插即用的通用操作策略模块,集成到现有机器人中间件(如 ROS 2)或云机器人平台。具体方式:

  • 通过标准化共享 Query 接口提取视觉–语言特征,下游接具身特定 MoE 动作头输出原生关节或末端位姿指令。
  • 训练分为两阶段:第一阶段利用无动作视频学习动态先验,可复用大规模跨具身数据;第二阶段在带动作标注的演示数据上联合微调,与现有数据收集流程兼容。
  • 推理时只需传入机器人元数据,自动路由到对应专家网络,无需代码分支。

具体落地用例:

  1. 电商仓储:某物流中心引入多品牌 AMR 和协作臂,使用 DyPES-VLA 统一调度,从货架取货(移动底盘)到包装台(固定臂)一条链路,减少定制开发人月,加快部署速度。
  2. 智能工厂:电子组装线上,不同工位的 SCARA 和六轴机器人共享同一个装配策略,模型根据工位传感器反馈动态调整动作,实现产线快速换型。

局限

  • **两阶段训练流程依赖无动作视频预训练**,这引入额外的数据需求和训练开销:第一阶段需大量跨 embodiment 的无动作交互视频来学习动态先验,若缺乏此类数据则模型难以充分捕捉物体运动和接触等通用场景变化。虽然作者验证了未来预测目标的有效性,但未讨论预训练数据不足时的退火策略,实际部署时可能需要针对新环境收集额外视频。
  • **MoE 动作头虽避免了手动对齐动作格式,但增加了模型复杂度与可解释性风险**。特定 embodiment 的专家网络各自独立,路由机制在推理时需正确识别当前 embodiment,一旦元数据标识不准确或出现未见过的 embodiment,路由错误可能导致灾难性失败。此外,共享注意力层捕获的时间动作结构是否对任意运动学约束都有效,仍需在更极端的形态差异(如足式与轮式)上验证。
  • **评估的 embodiment 多样性有限**:实验仅覆盖 LIBERO、RoboCasa-GR1 和 RoboTwin 2.0 等较常见机械臂形态,尚未在灵巧手、移动平台协同或双手机器人等更异构形态上进行系统测试。因此,虽然 DyPES-VLA 在现有基准上达到 SOTA,但其声称的跨实施例泛化能力可能仍局限于相近的末端执行器配置,对更广义的机器人设计(如软体、连续体)泛化性能存疑。
论文Junfeng Li2026-08-06原文

相关内容