论文

τ0-WM: 用于机器人操控的统一视频-动作世界模型

τ0-WM: 用于机器人操控的统一视频-动作世界模型

机器人操控需要模型能生成可执行动作,并在物理执行前预测和评估其未来后果。我们提出 τ0-World Model (τ0-WM),一个统一的视频-动作世界模型,将策略学习、视频预测和动作评估整合在一个未来预测框架中。 基于共享的视频扩散骨干,τ0-WM 提供两个互补接口:视频动作模型 从多视角观测、语言指令和机器人状态中联合预测未来视觉潜变量和连续动作块;动作条件视频模拟器 将候选动作块展开为多视角未来帧,并预测密集的任务进度分数。模型在约 27,300 小时的真实机器人遥操作、UMI 式交互、第一人称人类视频以及回放或失败轨迹上训练,使用模态特定监督掩码。 推理时,τ0-WM 利用测试时计算来采样动作候选,通过重去噪一致性排序,并对低质量候选调用基于模拟器的修正。在具有挑战性的长时域和细粒度机器人操控任务上,τ0-WM 表现出优于其他相关基线的性能。

论文精读

TL;DR τ_0-WM 以共享视频扩散骨干统一策略学习、视频预测与动作评估,并通过测试时重去噪一致性排序与模拟器修正,在长时程精细机器人操作上取得领先性能。

问题

问题背景

机器人操作领域正从单任务策略学习转向构建 世界模型(World Model),期望模型能够预测动作的未来结果,从而在物理执行前进行思考和优化,实现更可靠的长期规划。

现有方法局限

当前方法通常将 策略学习视频预测动作评估 分割为独立模块,缺乏统一框架。策略模型往往仅输出动作,不显式预测未来视觉状态,无法评估动作的长期影响;视频预测模型虽能生成未来帧,但难以直接输出可执行的动作,且评估动作质量时依赖外部奖励信号。此外,这些模型多基于单一数据模态训练,未能充分利用异构机器人数据的互补性。推理时,多数系统仅做一次前向生成,缺乏基于未来预测的多候选排查与择优机制,导致在长时序、精细操作任务中表现脆弱。

技术挑战与重要性

构建统一的视频-动作世界模型面临两大挑战:多模态未来的联合建模计算效率。模型需同时处理多视角图像、语言指令、机器人状态,并生成连续动作序列与未来视频潜变量,这要求设计高效的共享骨干网络。更关键的是,如何利用模型自身的预测能力进行 测试时计算(Test-Time Computation):采样多个动作候选、通过未来视频的生成质量对其进行排序,并对低质量候选进行修正。这种做法类似大语言模型中的思维链推理,能显著提升复杂任务的成功率,是通往通用机器人操作智能的重要路径。

行业类比

这类似于自动驾驶中,感知-预测-规划的一体化模型,将未来轨迹预测与决策相结合,并通过仿真验证与择优来提升安全性;又或是大模型推理中的最佳-of-N 采样与重排序,利用模型自身能力在输出前筛选最优解。

核心洞察

  • 将策略学习、视频预测和动作评估统一在一个共享视频扩散骨干中,使模型能够自洽地生成动作并预见其后果,消除了传统分体式架构中的表示割裂与误差累积。与常见方法(如独立训练的视觉编码器加策略头,或单独的世界模型用于模拟)不同,τ0-WM 的联合训练让视觉未来预测与行动决策共享同一生成先验,从而让模拟器为策略提供更准确的反馈,策略也能利用模拟器的隐式物理常识,整体提升长期任务的规划可靠性。
  • 在推理阶段引入重去噪一致性评分和模拟器驱动的动作纠正,提供了一种沿测试时计算维度提升机器人操作性能的实用方案。不同于多数方法仅依赖一次前向推理或简单的多数投票,τ0-WM 利用扩散模型的多步去噪特性,通过衡量不同噪声初始下生成动作的一致性来自动识别高质量候选,并对低分候选启动视频模拟器进行基于进度的修正,大幅减少了无效试错与不安全执行的风险。

方法

输入与表征

τ₀-WM 接收多视图 RGB 图像机器人本体状态(关节角度、末端位姿等)及语言指令,将多模态输入统一编码后送入共享的视频扩散骨干。视频扩散模型基于扩散 Transformer(DiT),隐空间中以潜变量表示视觉信息,文本指令经 CLIP 编码后通过交叉注意力注入。

共享骨干与双接口设计

模型核心为同一个预训练视频扩散模型,在训练与推理时切换两种模式:

  1. 视频动作模型(VAM):接收当前观测与指令,通过联合流匹配目标同时预测未来视觉潜变量序列连续动作块(以本体状态差分形式)。视觉预测与动作生成共享去噪过程,迫使模型学习物理一致性。
  2. 动作条件视频模拟器(ACVS):以候选动作块为条件,从当前视觉潜变量出发生成多视图未来视频,并额外输出每帧密集任务进度分数(0~1),用于动作评估。

训练策略

训练数据约 27 300 小时,包含真实机器人遥操作、UMI 式交互、人类自我中心视频及失败回放。通过模态特定监督掩码处理异质数据:遥操作数据可同时监督视觉与动作,人类视频仅监督视觉,失败轨迹用于强化进度预测的判别能力。优化目标结合流匹配损失(视觉)与 Huber 损失(动作),并加入进度回归损失。

输出与部署

推理时 VAM 生成多个动作候选,计算重去噪一致性分数(多次加噪-去噪的潜变量稳定性)进行排序,对低分候选调用 ACVS 回滚矫正,最终输出校准后的连续动作块直接下发执行。

与同类方法的差异

τ₀-WM 将策略学习、视频预测和动作评估统一在单一扩散模型中,而非像 RT-2 等先训策略再外挂预测器;同时利用测试时计算进行自校正,避免了传统模型预测控制中多步推演的高昂代价,直接以视频一致性作为动作优选依据。

实验

实验设计

τ₀-WM 在挑战性长时程与细粒度操作任务上评估,任务覆盖多视角、语言指令引导的复杂技能。训练数据为约 27,300 小时的混合数据:真实机器人遥操作 (Real-Robot Teleoperation)、UMI 风格演示 (UMI-style Demonstrations)、第一人称人类视频 (Egocentric Human Videos) 及 rollout / 失败轨迹 (Rollout and Failure Trajectories)。训练时采用模态特定监督掩码,使单一视频扩散骨干支持策略学习、视频预测和动作评估的联合优化。

推理阶段引入 测试时计算 (Test-Time Computation):先采样多个动作候选,通过 重去噪一致性评分 (Re-denoising Consistency Score) 排序,再对低质量候选调用 动作条件视频模拟器 (Action-Conditioned Video Simulator) 进行修正。此设计使模型在不重新训练的情况下动态提升动作质量。

关键发现

  1. 统一世界模型的效能:共享视频扩散骨干的双接口(视频动作模型 + 视频模拟器)在单一前向预测框架下协同工作,消除了传统分离式流水线中的信息瓶颈。
  2. 测试时计算的增益:重去噪一致性与模拟器修正的组合大幅滤除了不合理动作,尤其在长序列任务中降低了累积误差。
  3. 多源数据的互补性:将机器人特定数据与人类自我中心视频混合训练,提升了视觉表征的泛化能力,使模型在未见场景下仍能保持稳健。

与基线的深度对比

论文虽未提供具体数值,但指出 τ₀-WM 显著优于其他相关基线。定性分析表明:传统 Video Action Models 常忽略动作的远期后果,而独立 Video Simulators 则未与策略学习紧密整合。τ₀-WM 通过共享骨干实现双向信息流:策略生成的动作可在模拟器中展开验证,模拟器产出的进度评分又可反馈为策略改善信号。这种闭环设计让模型不仅能“想象未来”,还能“评价并修正未来”,在需要精细力学交互和长规划的任务中展现出错纠正能力。对工程实践而言,该架构提供了一个将离线训练、在线规划与自我反思统一起来的范本,适合在真实机器人部署中渐进式提升可靠性。

行业影响

落地场景

τ₀-WM 作为统一的视频-动作世界模型,可直接赋能需要长时域、精细操作的机器人产品。典型场景包括:

  • 仓储物流:货物分拣、打包、码垛等环节,需要连续动作序列生成与实时纠错;
  • 柔性制造:精密装配、线束插接等对力控和时序要求极高的任务;
  • 服务机器人:家庭或商业环境下的多步骤物体操作(如摆盘、清洁);
  • 自动驾驶与移动机器人:将视频预测用于未来场景推演,辅助规划决策。

商业价值

  • 降本:通过动作预测与模拟评估一体化,减少在线试错成本和物理环境调试时间,训练数据复用(27,300 小时多源数据)降低采集成本。
  • 增收:提升机器人操作成功率和任务完成速度,使自动化方案在复杂长时域场景中具备经济可行性,从而打开新市场。
  • 体验提升:推断阶段的 测试时计算 机制(重去噪一致性排序 + 低质候选校正)增强动作输出的稳定性和安全性,减少人工干预,提升用户信任。

与现有产品/工作流的接口

τ₀-WM 基于扩散模型,可无缝集成到现有机器人软件栈中:

  • 感知层:接收多视角图像与机器人状态,兼容主流视觉编码器;
  • 规划控制层:作为插件替换或增强现有策略模型,输出潜码表征的动作块,可通过 ROS 节点发布控制指令;
  • 仿真层:利用其动作条件视频模拟器进行“想象推演”,与现有数字孪生平台(如 NVIDIA Isaac Sim)互补,提供轻量级视觉预测。
  • 训练管线:可接受统一的多源标注数据,通过模态掩码灵活切换任务(策略学习 / 视频预测 / 进度评估),便于在已有数据飞轮中扩展。

具体落地 Use Case

  1. 电商仓储多品类拣选:在无预设货品模型的高波动 SKU 仓库中,机器人根据语言指令和当前视野,利用 视频动作模型 预测下一个抓取姿态与放置序列,同时由 动作条件模拟器 滚动评估任务完成概率,大大降低因物体形状/材质差异导致的失败率,支撑 24/7 自动化履约。

  2. 汽车总装线束插接:一段线束插接需要多个连续的精细动作,且每一步都可能因形变而失败。τ₀-WM 可部署在机械臂工作站,实时生成候选动作块,通过 重去噪一致性 评分筛选出理想轨迹,并在低置信度时调用模拟器“想象”插接结果进行校正,显著提升首次插接成功率和产线节拍。

局限

  • **训练数据依赖大量真实机器人遥操作**:模型训练使用了约 27,300 小时的遥操作、UMI 风格互动与自我中心人类视频,这种规模化数据收集成本高昂且覆盖场景有限,可能影响模型在全新机器人形态或任务上的泛化能力。论文未深入讨论仿真数据利用或域随机化的消融,暗示对高质量真实世界动作的强依赖。
  • **推理计算开销较大**:测试时计算包含多次采样、重去噪一致性评分与低质量动作的模拟器矫正,显著增加了单次推理延迟。对于要求高频率(如 50–100 Hz)的实时操控场景,这种依赖多轮扩散去噪与视频生成的架构可能难以满足低延迟需求,限制了在资源受限硬件上的部署。
  • **联合训练目标的权衡**:统一视频扩散骨干同时优化视频预测、动作生成和进度评分,可能在不同子任务间存在容量竞争,导致对细粒度长序列任务的预测精度受限。论文未充分量化单一模块与联合训练在各维度上的性能损失,且可解释性较弱,难以诊断失败源于哪个子模块。
论文Pengfei Zhou2026-05-31原文

相关内容