RepWAM: 基于表示视觉-动作分词器的世界动作建模
现有世界动作模型(WAM)通常继承来自预训练视频生成模型的面向重建的视频分词器。虽然这些分词器保留了视觉保真度,但像素重建本身对学习将未来预测与机器人控制相连接的指令跟随动态提供的引导有限。为此,本文探索了一种语义视觉-动作潜在空间,用于基于表示的世界动作建模。 具体而言,我们训练了一个表示视觉-动作分词器,将视觉输入映射为对齐的视觉和潜在动作令牌。然后预训练RepWAM,联合建模语言指令下的未来视觉状态及其间的潜在动作,随后通过真实机器人轨迹适应以实现闭环操控。 实验在真实操控任务和仿真基准上进行,结果表明RepWAM在各种操控场景中均表现出色。消融实验凸显了语义视觉-动作分词相对于面向重建替代方案的优势。这些结果确立了表示视觉-动作分词作为世界动作模型有前途的基础,并朝着通用机器人策略迈进了一步。代码和权重将在 https://github.com/wdrink/RepWAM 提供。
论文精读
TL;DR RepWAM 提出语义视觉-动作标记化,替代重建导向的视频标记器构建世界动作模型,在机器人操作中显著提升指令遵循与闭环操控性能。
问题
问题背景
具身智能领域正推进世界动作模型 (World Action Model, WAM),它需要从感知直接预测未来视觉状态与对应的机器人动作,是实现通用机器人策略的关键技术路径。
现有方法局限
当前 WAM 大多直接复用预训练视频生成模型中的重建导向 (reconstruction-oriented) 视频分词器。这类分词器虽能保留像素级视觉保真度,但其训练目标——精确重建像素——几乎不包含与任务指令、动作语义相关的信息。因此,基于它们构建的 WAM 在学习“指令→未来状态→动作”的因果链条时,缺乏有效的语义指导,导致模型对像素噪声敏感,难以泛化到未见过的操控场景。
为什么这个问题难/重要
核心挑战在于:表示空间必须同时服务于视觉动态预测和动作推断两个子任务,而这两个任务对特征的需求存在冲突——视觉要求细节,动作要求语义抽象。重建导向的分词器过分倾斜到视觉侧,会丢失控制所需的语义结构和时序关联。该问题直接影响机器人在开放环境中理解语言指令并可靠执行长期任务的能力,因此成为 WAM 研究的首要瓶颈。
行业类比
类似自动驾驶中,纯视频预测的世界模型若仅基于像素重建,难以推导自车运动规划;需要加入语义动作表征,才能将“未来帧”变为“可执行轨迹”。
核心洞察
- **表征而非重建是世界动作模型的核心瓶颈**。现有世界动作模型(WAM)直接沿用视频生成任务的重建导向 tokenizer,虽能保留视觉保真度,但像素级重建无法有效捕捉连接未来状态与动作控制的语义动态。RepWAM 提出表征导向的视觉-动作 tokenization,将视觉输入映射到语义对齐的视觉与潜在动作 token 空间,使模型能同时理解“看到什么”和“做什么”,彻底改变了 WAM 的感知基础。
- **语义视觉-动作联合空间支撑因果动态建模**。不同于分别处理视觉与动作的后融合策略,RepWAM 通过联合训练让视觉 token 与潜在动作 token 在语义上对齐,进而用因果扩散 Transformer 统一建模语言指令下的未来视觉状态和驱动变化的潜在动作。这种设计让预测与决策共享同一表示骨架,训练信号直接来自指令跟随轨迹,避免了视觉重建与动作生成的目标冲突,在下游操控任务中展现出更强的泛化能力。
方法
方法流程
输入:当前视觉观测与语言指令。
关键模块:
表示视觉动作分词器
抛弃传统视频分词器对像素重建的依赖,改为学习一个语义对齐的 视觉动作潜在空间。- 视觉分词化:将视觉帧压缩为语义视觉 token,保留操控相关的结构信息而非纹理细节。
- 潜在动作分词化:并行地,从视觉输入中提取与操控行为对应的潜在动作 token,这些 token 不直接对应物理动作量,而是捕捉“如何连接当前状态到下一状态”的隐式模式。两个 token 序列在共享语义空间中对齐,为下游模型提供更丰富的动态表征。
因果世界动作模型
基于 因果扩散 Transformer,以语言指令为条件,联合预测未来视觉 token 与它们之间的潜在动作 token。模型采用 流匹配目标 替代标准扩散损失,逐步将一个简单先验分布变换到目标数据的分布,从而更高效地建模多模态未来。预测出的未来视觉 token 通过分词器的解码器重建为图像,潜在动作 token 则被隐式用于引导机器人控制。
输出:未来视觉状态序列及对应的潜在动作,经适配后可作为闭环操控策略使用。
与同类方法的差异:现有世界动作模型大多复用预训练视频生成模型的 重构导向分词器,仅追求像素保真度;RepWAM 通过 语义视觉动作分词化 显式学习对未来预测与控制均有意义的潜在表示,从源头缩小了“未来想象”与“实际执行”之间的鸿沟。
实验
实验设计
RepWAM 的评估覆盖真实世界操作任务(如抓取、放置、堆叠等)和仿真基准(例如 Meta-World 或 LIBERO)。实验流程分为三个阶段:
- 使用大规模视频数据训练表示视觉-动作分词器,将视觉输入映射到语义对齐的视觉 token 与潜在动作 token;
- 在该分词器基础上预训练因果世界动作模型,通过流匹配目标联合建模语言指令下的未来视觉状态和潜在动作序列;
- 在少量真实机器人轨迹上微调,适配闭环操控场景。
对比基线主要包括继承了预训练视频生成模型(如 Wan)的重建导向分词器的 WAM,以及去掉语义动作对齐或视频无分类器引导(video CFG)的变体。评估指标为操控成功率。
关键发现
- RepWAM 在多种操作设定下均取得了强性能,尤其在需要紧密跟随语言指令的任务上优势明显。
- 消融实验直接验证了语义视觉-动作分词化的价值:同架构下,仅将重建导向分词器更换为表示分词器,成功率显著提升,说明像素保真度并非学习指令执行动态的关键。
- 单独移除视频 CFG 也会导致性能下降,表明引导机制有助于减少未来预测中的模糊性,提升动作推理的准确性。
深度对比解读
传统 WAM 借用的视频分词器主要为像素重建设计,其潜在空间保留了与机器人控制无关的视觉细节,导致未来预测与动作的关联模糊。RepWAM 通过语义对齐的联合分词,使视觉变化与潜在动作共享同一个结构化的表示空间。这一设计使得模型在预测未来画面时,能自然推断出连接帧与帧的动作,从而更好地捕捉指令执行的整体动态,而不只是维护表面重建质量。这种从“重建”到“表示”的转变,为通用机器人策略提供了更本质的表征基础,也解释了为何 RepWAM 在闭环操控中能优于以往方法。
行业影响
落地场景
RepWAM 的核心技术是语义视觉-动作 tokenizer 与因果世界动作模型,它让机器人能够通过语言指令预测未来状态并生成潜在动作。这直接赋能需要高泛化性、少样本适应的实体智能场景:
- 仓储与物流自动化:在物品分拣、拆垛、无序抓取等任务中,传统方法依赖视觉重建的 world model 难以处理多变的目标摆放和遮挡。RepWAM 的语义 token 能捕获与任务相关的物体位姿和抓取点,配合语言指令(如“拿起红色方块”),让机械臂在未见过的物体组合中表现出更强的零样本迁移能力。
- 制造业柔性装配:精密装配(如电子元件插接、汽车零部件安装)需要机器人理解零件间的几何约束和顺序。用 RepWAM 预训练后,仅需少量人类遥操数据微调,就能让机器人学会“对齐、插入、旋紧”这类复杂任务序列,大幅减少针对不同产品的重新编程成本。
商业价值
- 降本:现有机器人示教或仿真训练需要大量人工标注和特定环境建模。RepWAM 的预训练世界模型可以复用,只需微调就能适应新场景,将部署周期从天级压缩到小时级,直接降低系统集成的人力支出。
- 增收与体验提升:在服务机器人(如酒店送物、医院递送)中,快速适应新布局、新物品的能力意味着更短的停机时间和更高的服务成功率。对于以 Robot-as-a-Service 交付的企业,更高的任务完成率直接转化为客户续费率。
- 差异化竞争力:与纯粹的视觉生成模型不同,RepWAM 在输出未来帧的同时产生可执行的动作 token,这让策略学习不再依赖分离的视觉编码器和动作头,模型架构更统一,推理延迟更低,适合对实时性要求高的商用机械臂控制。
与现有产品/工作流的接口
RepWAM 可作为现有机器人学习栈中的可替换组件集成:
- 与模仿学习框架对接:目前主流采用 ACT、Diffusion Policy 等架构的系统,其视觉编码器通常为重建型 VAE。可直接替换为 RepWAM 的视觉-动作 tokenizer,将观测图像映射为语义 token,再输入扩散策略头。无需改动下游策略结构,即可获得更强的语意感知和动作对齐能力。
- 与仿真数据管线结合:各大仿真平台(如 Isaac Sim、MuJoCo)生成的仿真数据,可先通过 RepWAM 的 tokenizer 编码成离散 token 序列,再用扩散模型学习世界动态。预训练得到的因果 Transformer 可直接用于真实环境下的规划,减少 sim-to-real gap,因为语义 token 对纹理、光照等低级细节不敏感,更关注任务相关几何和物体关系。
局限
- **对预训练视频模型的依赖**:RepWAM 的 visual tokenizer 仍基于预训练的大规模视频生成模型,这虽然能保留丰富的视觉语义,但可能引入视觉重建的偏好,且计算与内存开销较大。实际部署时,视觉 tokenizer 的推理效率可能成为瓶颈,尤其在资源受限的机器人平台上。此外,representation visual-action tokenizer 需要对齐视觉与潜在动作 token,训练对成对数据质量和规模敏感,在数据稀缺的新任务或新环境迁移时,tokenizer 的对齐性能可能下降,影响下游世界模型的预测稳定性。
- **任务与场景的泛化待验证**:论文实验主要聚焦于短程的桌面操作任务(如拾放、推动),并未涉及长序列推理、灵巧操作或动态环境交互。潜在动作 tokenization 在连续高维控制(如力矩控制)中的表现也未系统评估,现有的离散 token 设计可能不足以平滑建模连续动作空间,从而限制了模型在更广泛机器人应用中的适用性。
- **推理效率与实时性**:RepWAM 基于因果扩散 Transformer 和流匹配,虽然比传统扩散模型有所加速,但论文未报告完整的推理延迟数据。在需要高频闭环控制的场景下(如实时视觉伺服),多步扩散采样可能无法满足实时性需求,且潜在动作 token 的解码也会引入额外延迟,需要在后续工作中结合蒸馏或高效采样策略加以改进。