论文

WorldToken: 面向机器人模仿学习的时间优先序列建模

WorldToken: 面向机器人模仿学习的时间优先序列建模

机器人策略在每个决策步骤接收异构观测,但序列模型在时间维度上组织这些输入的方式各不相同。我们提出 WorldToken,一种时间优先的策略实例化,它将多视角图像、本体感觉和任务条件在每个策略时间步内融合为一个世界标记。随后,一个因果时序 Transformer 对生成的世界标记序列进行建模,并由扩散动作头生成动作块。 在 RoboCasa 的 23 个任务上,一个 8530 万参数的策略(除冻结的预训练 CLIP 文本编码器外从头训练)使用每任务 2900 条生成演示,实现了 59.45% 的平均闭环成功率。对五种数据集规模、五种模型规模和两种训练种子进行完整析因扫描表明,额外目标域数据带来一致收益,而中等模型规模后收益递减。 在同一检查点历史截断下,将可见历史减少到一或两个策略时间步会降低所有 50 个 RoboCasa 策略的闭环成功率。在 RMBench Blocks Ranking 上,将可见历史从 146 秒减少到 8 秒会使评估者成功率从 95% 降至 28%,而探索性扩展 rollout 则维持参考交换序列超过 850 秒。 这些结果证明了完整 WorldToken 实例化的经验可行性,并刻画了其在所测试配方下的数据扩展和时序上下文行为。但结果并未证明其优于其他序列组织方式,也未隔离完整实现中驱动观测性能的具体组件。

论文精读

TL;DR WorldToken 将每个策略步的多视角、本体感知与任务条件压缩为单一 world token,用因果 Transformer + 扩散头按时间优先建模;在 RoboCasa/RMBench 上刻画了数据扩展与历史长度对闭环操控的关键作用。

问题

问题背景

机器人模仿学习领域正从单任务、单视角的简单控制,转向多任务、多模态输入的通用策略。核心关注点是如何组织每个决策步的异构观测(多视角图像、本体感知、任务语言条件),使序列模型能有效学习时间上的因果依赖。

现有方法局限

主流序列模型在机器人策略中的 token 组织方式存在明显局限:

  • 模态优先的拼接:将不同模态(如 RGB 图像、关节角度)分别编码后简单 concatenate,时间信息被打散在 feature 维度,模型难以区分不同时间步的观测。
  • 图像 patch 化 + 空间优先:类似 ViT 的方式将每帧图像切成 patch,再将所有时间帧的 patch 拼成超长序列。这导致单个时间步的语义被拆散,跨步注意力容易淹没在大量 patch 中,且推理成本随历史长度线性爆炸。
  • 历史观测作为 cross-attention 条件:将过去帧作为额外 context 输入,但通常只做单向信息聚合,缺乏对时间步之间直接因果关系的建模。

为什么这个问题难/重要

机器人控制是闭环、部分可观测的决策问题:策略不仅需要当前观测,还必须利用最近的历史来推断速度、接触状态、任务进度等不可直接感知的量。异构输入的时间尺度与空间分辨率差异极大,统一 token 化容易丢失物理时间的结构。同时,模仿学习数据昂贵,模型的数据扩展性和参数扩展性直接决定工程落地可行性。业界对视觉-语言-动作(VLA)模型投入大量资源,正是因为时间优先的序列组织可能带来与 LLM 类似的 scaling 效益。

行业类比

如同一篇文本被切成 token 后,语言模型才能捕获词序与语法;WorldToken 将每个物理时间步压缩为一个 world token,让策略像大语言模型读文本一样,按时间顺序阅读物理世界的因果流。

核心洞察

  • Time-first 组织将每个决策步的多模态观测融合为单一世界 token,用因果 Transformer 直接建模时间序列。与常见做法中分模态 token 化后在时间维度交错或通过跨注意力融合不同,WorldToken 把物理时间作为第一序列轴,使每个时间步的全局状态作为基本单元参与因果注意力,避免了模态间时间对齐的复杂性。截断实验表明策略对最近历史高度依赖,且短上下文策略能适应训练上下文,说明该时间接口塑造了策略的记忆行为。
  • 数据与模型容量的 scaling 行为呈现“数据收益持续、模型容量饱和”特征:在 23 个 RoboCasa 任务中,85.3M 参数模型使用 2900 演示达到 59.45% 成功率,扩大模型未带来显著提升,但增加目标域数据持续增益。这与大模型领域常见的模型规模收益明显不同,对机器人模仿学习来说,中等规模模型配合大量针对性数据可能更具部署价值。作者也谨慎指出未建立对替代序列组织的优越性,但该 scaling 特征为实际资源分配提供了参考。

方法

输入组织

世界模型以物理时间为主轴,每个策略时间步的多模态观测——多视角图像、本体感觉(proprioception)与任务条件(如语言指令)——被融合为单个 world token。这一设计将异构输入压缩到统一表征,避免不同模态在时间维度上交错排列。

关键模块

  1. Within-timestep 多模态编码:将上述异构输入投影到同一特征空间,生成每个时间步的 world token。任务条件使用冻结的 CLIP 文本编码器,视觉与本体感觉编码器则从零训练。
  2. Causal temporal Transformer:对 world-token 序列执行因果自注意力,每个 token 只能关注当前及历史 token,从而显式建模时间依赖。该 Transformer 为策略主干,参数量 85.3M,全部从零训练(除 CLIP 冻结)。
  3. Diffusion action head:从 Transformer 最后一层的隐状态出发,通过扩散过程迭代去噪,生成动作块(action chunks),支持多步动作预测。

输出与训练

输出为动作块,用于闭环控制。训练采用模仿学习范式,基于目标域生成演示(如 2,900 条/任务),端到端优化扩散损失与动作拟合。

与同类方法的差异

不同于将多模态观测作为独立 token 序列(如视觉 token + 本体 token 交错输入)的做法,WorldToken 强制每个时间步的观测先融合为单一 token,使序列结构完全由时间驱动,简化了跨模态依赖建模,并将时间上下文长度与模型计算成本解耦。

实验

实验设计

  • 在 RoboCasa 基准上评估 23 个任务的多任务控制,使用 85.3M 参数策略从零训练(仅冻结 CLIP 文本编码器),每任务 2900 条生成演示。
  • 完整因子扫描:5 种数据规模 × 5 种模型规模 × 2 个训练种子,分析数据与模型容量的扩展规律。
  • 在 RMBench Blocks Ranking 上评估可见历史长度(146s vs 8s)对排序任务的影响,并测试扩展 rollout 的持续多交换行为。

关键发现

  • RoboCasa 上实现 59.45% 平均闭环成功率;数据扩展带来一致提升,模型容量超过中等规模后收益递减。
  • 历史截断显著损害性能:50 个策略在可见历史降至 1-2 步时成功率下降;RMBench 中可见历史从 146s 缩至 8s 时成功率由 95% 暴跌至 28%。
  • 扩展 rollout 可持续执行参考交换序列超过 850 秒,表明长上下文有助于维持有序行为。

基线对比解读

  • 论文明确不主张对替代序列组织方式的优越性,也未提供与 SOTA 策略的直接闭环对比;所报告数值应视为完整 WorldToken 实例的经验可行性验证。
  • 与常见将观测分开放置的序列组织相比,WorldToken 将每个时间步的多模态观测融合为单一世界 token,再输入因果 Transformer,但该设计的相对优势尚未通过隔离实验证明。
  • 本地 BC-Transformer reference 仅作参考,未作为主要对比基线,结论需谨慎解读。

行业影响

落地场景

WorldToken 的时间优先序列组织方式,可直接用于通用机器人操作策略 训练,尤其适合需要融合多视角图像、本体感知与语言指令的场景。典型用例:

  • 电商仓储分拣:机械臂在多摄像头环境下完成抓取、放置、装箱,WorldToken 将每步异构观测压缩为单 token,利于部署轻量推理。
  • 自动驾驶数据闭环:模仿学习从人类驾驶数据中生成动作 chunk,可嵌入现有 planning 模块做行为克隆初始化。
  • 医疗辅助机器人:手术器械操作、康复训练中,多模态时序建模可提升对动作历史的利用。

商业价值

  • 降本:85.3M 参数量从零训练即可达到 59.45% 平均闭环成功率,相比更大模型或人工采集数据,训练与推理成本显著降低。
  • 数据效率:论文结果显示在 2900 条演示/任务 时,增加目标域数据带来稳定提升,可减少对昂贵遥操作数据依赖,加速产品迭代。
  • 体验提升:动作 chunk 的生成方式让机器人对短时序扰动更鲁棒,物流/服务场景中减少卡顿与误操作,提升自动化可靠性。

与现有产品/工作流接口

  • 可作为 策略 backbone 插入现有机器人学习框架(如 robomimic、LeRobot),只需将多模态编码改为 world token 融合模块。
  • 训练流程兼容离线模仿学习,无需在线交互即可从已有演示数据训练,适合企业私有数据集快速微调。
  • 推理端用单个 causal Transformer 处理 token 序列,可部署到边缘设备;扩散动作头输出连续动作 chunk,与现有运动规划器/控制器通过 ROS 接口对接。

局限

  • 论文明确承认当前结果未建立对其他序列组织方式的优越性,也未隔离完整 WorldToken 实现中哪一组件(world token 融合、因果 Temporal Transformer、扩散动作头)主导性能。缺乏逐组件消融实验,读者无法判断这些设计是否均不可或缺,也难以定位后续改进方向。
  • 实验仅在仿真基准(RoboCasa、RMBench)上完成,未涉及真实机器人部署,sim-to-real 迁移能力未知。训练依赖生成演示而非真实专家数据,可能引入仿真特有的偏差。模型规模 85.3M 相对较小,且扫描显示超过中等规模后收益递减,暗示架构对大规模扩展的利用效率有限。
  • 历史截断实验使用训练好的固定上下文模型进行分布外截断测试,可能高估历史的重要性。论文未与现有统一 token 序列的多模态机器人策略(如 RT-2、OpenVLA 等)进行直接对比,缺乏相对性能证据,难以判断时间优先组织方式的实际优势。
论文Chunkai Yang2026-08-23原文

相关内容