论文

Dynin-Robotics: Omnimodal 统一 Diffusion Vision-Language-Action 模型

Dynin-Robotics: Omnimodal 统一 Diffusion Vision-Language-Action 模型

视觉目标与动力学预测能为语言条件的机器人策略同时提供目标结果,以及动作相关场景变化的表示。本文通过共享轨迹模型,将这两类预测引入动作生成与选择。 Dynin-Robotics 在 Dynin-Omni(omnimodal masked-diffusion backbone)上实现该形式化,把语言、视觉观测、目标与动作均表示为离散 token。通过改变条件与目标 span,同一模型可学习动作预测、动作条件下一观测预测、终端目标状态预测与轨迹到指令重建;这些接口支持目标预测、动作候选评估、以及动作与未来状态预测联合精修的 test-time scaling。 训练在来自 48 个 Open X-Embodiment 数据集的约 133 万条轨迹上持续预训练,并分别适配下游领域。在 VLABench 两个任务上,机器人预训练在固定 Stage-2 步数预算内提升适配效果;相同耦合解码器下,完整目标组合较 Policy-only 后训练提升 shifted-instruction 成功率;结合目标引导与动作—下一状态联合去噪可进一步提升该指标,收益取决于预测的组合方式。 Dynin-Robotics 在 LIBERO 与零样本 LIBERO-Plus 上表现有竞争力,并在 Franka Research 3 机器人四种操作条件下取得 78.4% 的平均成功率;优化后的 block-parallel 实现使模型侧动作解码相对基础实现最高加速 29.2 倍。这些结果说明,共享轨迹建模可作为学习互补机器人目标、并在控制中组合其预测的通用接口。

论文精读

TL;DR Dynin-Robotics 用一个共享轨迹模型统一视觉目标预测、动力学建模与动作生成,基于全模态掩码扩散,支持测试时扩展与联合去噪,在 LIBERO 等基准上取得有竞争力表现,解码加速达 29.2 倍。

问题

问题背景:语言条件机器人策略在跨任务泛化与数据效率上取得显著进展,但如何利用视觉目标与动态信息进一步增强动作生成质量仍是开放问题。

现有方法局限:

  • 基于 VLM 的策略仅将视觉观察编码为特征,缺乏对动作引发场景变化的显式预测,难以捕获操作后果。
  • 基于 VGM(视频生成模型)的策略可预测未来帧,但生成与动作选择相互分离,无法端到端优化,推理时也缺少联合细化机制。
  • 既有统一多模态模型通常只训练单一接口(如动作预测或观察预测),未同时学习目标状态预测、轨迹到指令重建等互补目标,限制测试时扩展能力。
  • 动作解码与未来状态预测若分开执行,无法互相约束,复杂长程任务中易累积误差。

为什么难/重要:

  • 技术挑战在于需设计离散 token 空间统一表示语言、视觉、目标与动作,并平衡多个条件目标的训练;推理时如何高效组合目标引导、候选重排序与联合去噪需要仔细设计。
  • 从工程角度看,测试时增加计算量(如 joint denoising)与实时控制延迟存在冲突,而统一轨迹模型有望降低多模块集成成本。
  • 业界对机器人基础模型的可扩展性、跨域迁移和多任务成功率高度关注,统一接口若能实现零样本泛化,将成为具身智能的重要范式。

行业类比:类似大语言模型通过思维链与测试时计算提升推理能力,该工作把目标想象与动态预测作为策略的“测试时扩展”手段,用额外计算换取任务成功率。

核心洞察

  • 统一轨迹建模把动作、视觉观察、目标和语言全部离散化为 token,在同一个 omnimodal masked-diffusion backbone 上通过改变条件 span 实现多任务学习。与常见的 VLA 策略和独立世界模型拼接方案不同,Dynin-Robotics 让策略生成、下一状态预测、终态目标预测和指令重建共享一个模型,避免了跨模型误差累积,并为测试时的联合去噪提供了可能。对工程而言,这一设计减少了部署组件数量,也让辅助任务直接帮助策略训练,而不是仅作为额外的监督信号。
  • 测试时缩放通过目标引导和候选动作评估把推理计算转化为成功率提升,为机器人控制提供了类似 LLM 的 scaling path。Dynin-Robotics 在推理时先用同一模型预测目标状态,再联合去噪动作与未来状态,或者用世界模型对多个动作候选打分;实验表明联合去噪优于仅动作解码,且效果取决于组合方式。这为算力有弹性时提升策略鲁棒性提供了新思路,也启发从业者不必局限于固定前向传播的 policy,可以在控制循环中动态分配计算。
  • 在 48 个 Open X-Embodiment 数据集上持续预训练统一模型,并结合 trajectory-to-instruction reconstruction 等辅助目标,显著提升了下游少样本适应和 shifted-instruction 迁移能力。相比直接在单一域上训练策略,这种大规模异构预训练让模型学到通用轨迹先验,后续 post-train 时用相同 Step 预算达到更高成功率。对于构建 robot foundation model,这验证了多任务、多目标预训练的价值,也为数据稀缺场景提供了可行的预训练策略。

方法

输入

语言指令、视觉观察(图像)、机器人动作序列,以及可选的传感器读数。所有模态统一转换为离散 token。

关键模块

  • Dynin-Omni backbone:omnidirectional masked-diffusion 模型,将多模态 token 序列作为统一表示,执行去噪生成。
  • 机器人 token 空间扩展:动作通过离散 binning 编码为 token;可选传感器接口进一步扩展词汇表。
  • 统一目标训练:通过变化条件掩码与目标 span,同一模型联合学习四个任务:
    1. 动作预测(条件语言+观察)
    2. 动作条件下的下一观察预测(隐式世界模型)
    3. 终端目标状态预测(给定语言和初始观察预测最终场景)
    4. 轨迹到指令重建(从动作轨迹生成语言指令) 损失为多任务加权和,辅助损失规模作为超参数。
  • 统一多阶段推理:
    • 仅动作解码(action-only)
    • 目标状态引导的动作解码(先预测终端目标,再以此为条件解码动作)
    • 联合动作-世界模型去噪(同时去噪动作 token 与未来观察 token,迭代细化)
    • 基于世界模型的候选重排(生成多个动作候选,利用预测的未来状态评估并选择最优)
  • 加速:采用块并行解码(block-parallel decoding),在测试配置下将模型侧动作解码加速高达 29.2 倍。

输出

根据任务目标,输出动作序列、未来观察、目标状态或语言指令。

与同类方法的差异点:传统方法分别训练策略、世界模型和目标预测器;Dynin-Robotics 通过共享轨迹模型统一这些互补目标,允许推理时任意组合预测,实现测试时扩展和联合细化。

实验

实验设计

Dynin-Robotics 在 Open X-Embodiment 的 48 个数据集共约 1.33M 轨迹上进行持续预训练,随后针对下游基准 LIBERO、LIBERO-Plus、VLABench 及真实 Franka Research 3 机械臂进行分领域后训练。推理侧支持三类测试时扩展:goal prediction、action-candidate evaluation、joint refinement of action and future-state predictions。

关键发现

  • 真实世界成功率达到 78.4%(四个操纵条件平均),同时在 LIBERO 上取得竞争性能,LIBERO-Plus 上保持零样本泛化。
  • 块并行实现将模型侧动作解码加速最高 29.2x(相对基础实现)。
  • 消融显示:持续预训练在固定 Stage-2 步数预算下提升 VLABench 适应;完整目标混合比仅策略后训练提升 shifted-instruction 成功率;目标引导结合联合动作-下一状态去噪进一步优于仅动作解码。

基线对比解读

与仅动作解码的扩散策略相比,引入共享轨迹模型统一了目标预测与动态预测,使动作生成获得更丰富的条件信号。消融表明预测组合方式影响增益,提示工程中需探索最优推理接口。LIBERO 上的竞争力验证了架构的通用性,但真实世界仅 78.4% 成功率表明部署仍有提升空间,特别是针对复杂指令迁移任务。

行业影响

落地场景

Dynin-Robotics 的统一轨迹建模适用于需要语言指令、视觉感知和动作执行的机器人操作任务。典型场景包括仓储物流中的分拣与码垛、制造业中的柔性装配、服务机器人中的多步骤操作(如整理物品、倒水),以及实验室自动化中的仪器操作。其目标状态预测和动作候选评估能力支撑了测试时缩放,适合对可靠性要求高的工业部署。

商业价值

该工作通过共享轨迹模型减少了对多个专用模型的需求,降低了模型训练与部署成本。联合去噪和世界模型候选重排序在推理阶段提升成功率,有助于减少错误操作带来的损耗。在真实机器人上 78.4% 的平均成功率(Franka Research 3)以及块并行解码最高 29.2 倍加速,意味着可更快部署到实际产线,提升吞吐。对于机器人初创公司和自动化解决方案提供商,这种统一接口简化了模型迭代,缩短了从实验室到产品的周期。

与现有工作流的接口

Dynin-Robotics 可作为机器人策略后端嵌入现有 ROS 或机器人中间件。其输出离散动作令牌,便于与运动规划器或底层控制器对接。世界模型预测的下一观察可用于状态估计与异常检测,与现有视觉系统互补。模型侧解码加速使其适合边缘设备或低延迟控制回路。开源代码 GitHub 和模型权重支持快速集成。

具体落地 use case

  • 电商仓储:移动机械臂根据自然语言指令(如“将红色盒子放到第二层货架”)执行拣选,并利用目标图像验证放置结果,减少人工复核。
  • 医疗实验室自动化:设备操作臂执行“将试管从 A 架移至 B 架并扫描标签”等指令,通过轨迹到指令重建辅助审计。

局限

  • **大规模预训练依赖**:Dynin-Robotics 的持续预训练基于 **48 个 Open X-Embodiment 数据集**与约 **1.33M 条轨迹**,数据规模与多样性对模型能力至关重要。这导致复现门槛高,资源受限团队难以验证其效果;同时,不同数据集的质量与分布差异可能引入噪声,需要精细的配比与平衡策略(如论文中的 balanced distributed rotation),进一步增加工程复杂度。与只使用单域数据的策略模型相比,其数据工程成本显著更高。
  • **推理延迟与实时性挑战**:虽然论文通过 **block-parallel decoding** 将 model-side action decoding 加速最高 **29.2x**,但完整的 test-time scaling 流程包括 **goal-state prediction**、**action-candidate reranking** 与 **joint action–world-model denoising** 等额外计算,可能仍难以满足高频控制需求(如 Franka 实时操控)。论文未报告端到端推理延迟或真实机器人控制频率,实际部署时可能需要更强大的硬件或牺牲部分性能换取速度。
  • **真实世界评估范围有限**:真实机器人实验仅在 **Franka Research 3** 上完成,覆盖四个操控条件,平均成功率 **78.4%**,但任务种类和场景变化较少。论文在 **VLABench** 上只选了两个任务,无法全面反映模型对长程、接触丰富或非结构化环境的泛化能力。与一些已在大规模真实机器人数据集上评估的工作相比,其真实世界证据仍显单薄,未来需在更多 embodiment 和复杂任务上验证。
论文Hoeun Lee2026-09-11原文

相关内容