论文

WALL-WM: 在事件关节处雕刻世界动作建模

WALL-WM: 在事件关节处雕刻世界动作建模

WALL-WM 是一种世界动作模型,将视频-动作学习从以固定长度块为中心的优化,转向基于语义事件的视觉-语言-动作 (VLA) 预训练,以语义连贯的动作事件作为原子学习单元。 现有世界动作模型通常从多模态或视频基础模型初始化,然后基于当前观测和指令直接优化固定长度的动作块。这种以块为中心的方式导致粒度不匹配:语言描述语义目标和事件,视觉通过连续场景动态演化,动作在控制级别时间尺度上运行;将三者强行对齐到相同固定长度预测窗口,使 VLA 训练退化为短视的相关性拟合。 WALL-WM 通过围绕语义事件组织监督和数据来解决该问题:它结合了事件驱动的 VLA 预训练和包含事件级描述与聚类平衡采样的数据生态系统,支持在多样化的行为、场景和任务结构上进行可扩展学习。同一事件预训练骨干支持两种互补推理模式: - 事件模式:接收下一事件描述,生成可变长度执行块。 - 统一模式:利用带有 Staircase Decoding 的视觉语言模型,在保持梯度连续的 VLA 路径同时,约束传统的固定长度块推理。 配合基于 Muon 优化器的大规模预训练基础设施,WALL-WM 为通用世界动作模型提供了实用的规模化方案。实验表明,WALL-WM 在语言、场景和任务上广泛泛化,在大规模真实世界泛化评估中达到最先进性能。

论文精读

TL;DR WALL-WM 用语义事件替代固定长度动作块作为视频-语言-行动预训练的原子单元,解决现有 VLA 模型的粒度不匹配问题,通过事件级标注、集群平衡采样和双推理模式实现灵活可扩展的行动建模和跨场景泛化。

问题

在具身智能领域,世界动作模型(WAM)正成为统一视觉、语言和动作的主流范式,但当前方法普遍以**固定长度动作块(action chunk)**为基本学习单元,将多模态观测和指令条件直接映射到等长动作序列,忽略了真实任务中天然存在的多尺度时序结构。

现有方法的局限主要体现在粒度不匹配:语言指令描述语义事件和目标(如“将杯子移至茶壶旁”),视觉流描述连续的场景动态,而动作则是毫秒级的底层控制信号。当三者被强制对齐到相同固定窗口时,模型被迫做短时相关性拟合,难以捕捉语言事件的全局结构和视觉-动作的条件依赖。此外,这种**块中心(chunk-centric)**的设定导致数据采样偏向高频短时模式,训练出的策略在面对长时序、重规划或稀疏语言指令时泛化能力显著下降,且无法自然地支持变长度执行。

为什么这个问题难且重要:多尺度对齐是跨模态学习的根本性挑战。语言、视觉和动作的底层物理时钟不同,将它们统一需要重新设计数据组织方式(如事件粒度标注)、模型架构(如双塔流匹配)和训练目标(如视频-动作时间步映射)。业界对通用操作能力的追求使得该问题备受关注,因为它直接关系到机器人能否像人类一样按语义事件灵活规划动作,而非死板地回放固定步数的轨迹。

一个可类比的场景是视觉-语言模型从固定分辨率输入到任意分辨率处理的演进:早期模型将图像暴力压至224×224,丧失细节;现在则通过动态分块机制保留原图信息。机器人世界模型同样需要从固定步块的“死板回放”走向语义事件驱动的动态调度,这是实现通用操作智能的关键一跃。

核心洞察

  • 现有视觉-语言-动作模型(WAM)普遍采用固定长度动作块预测,将语义目标、视觉动态与底层控制强制对齐于同一时间窗口,导致**粒度不匹配**与短视相关性拟合。WALL-WM 将学习单元从动作块重构为语义事件,通过事件驱动的预训练与数据组织,使模型能自然捕获跨时间尺度的依赖关系,从根本上突破了 chunk-centric 范式的局限。
  • WALL-WM 构建了一套以**事件级分层标注**与**集群平衡采样**为核心的数据生态系统,既保留了语言描述中的高级语义,又确保视觉-动作分布的均衡覆盖。这种数据工程策略使大规模预训练能够从高度异构的行为、场景与任务结构中稳定学习,为通用世界动作模型提供了可扩展的数据配方。
  • 模型通过事件模式和统一模式两种互补推理路径,在推理灵活性与部署效率间取得平衡:事件模式以语言描述驱动可变长度执行,统一模式则借助**阶梯解码**将 VLM 条件化固定块推理与梯度连续的 VLA 路径相融合,为实际系统提供了按需选择的能力。

方法

输入与整体流程

WALL-WM 以多视图视频和自然语言指令作为输入,将学习目标从传统的固定长度动作块预测转向语义事件驱动的建模。所谓事件,是指由语言描述界定的一段有始有终、语义连贯的动作序列。通过将事件作为原子学习单元,模型直接对齐语言的目标粒度、视觉的连续动态和动作的控制周期,解决了以往分块训练中的粒度不匹配问题。

核心架构组件

多视图视觉世界事件建模 从单视图预训练视觉基础模型继承先验,通过 Camera RoPE(旋转位置编码)注入多视图几何约束,并使用 跨视图几何掩码 保证不同视角的一致性;视觉生成采用基于流匹配的视频扩散模型。事件中心动作动力学建模 则利用一个动作 Transformer,通过分层耦合机制与视觉主干共享中间特征,并设计了视频-动作时间对齐策略和时间步映射,确保在扩散框架下动作预测与视觉生成同步,动作目标由扩散损失监督。语言引导推理 通过一个 VLM 将高层事件描述编码为条件信号,统一模式中还可以利用 阶梯解码 生成逐步细化的动作块条件,保留端到端的梯度流。

训练策略

训练分阶段进行:首先对视觉和动作模块分别进行大规模事件中心预训练,然后联合训练 VLM 条件化模块,再通过阶梯蒸馏和下一块适应微调提升实际部署性能。数据构建围绕事件级层次化字幕和集群平衡采样,确保行为、场景、任务覆盖的多样性。在基础设施层面,采用 Muon 优化器、细粒度流水线重叠和序列打包等技巧实现高效扩展。

双模式推理

  • 事件模式 接收下一个事件的文本描述,输出可变长度的动作执行块,允许根据语义灵活调整执行步长;
  • 统一模式 使用 VLM 阶梯解码,将高层事件语义逐步展开为固定长度块的条件,仍能维持 VLA 路径的梯度连续性,适合对实时性要求更高的场景。

与同类方法的区别

相较于 Octo、RT-2 等模型直接预测固定长度的动作块,WALL-WM 引入了语义事件作为中间表示,不仅使动作规划与自然语言指令的抽象层级更一致,也支撑了可变长度的动作生成,从而在复杂行为和大范围任务上表现出更强的泛化能力。

实验

实验设计

实验围绕两大主线:具身视频生成质量真实机器人操作泛化。视频评估考察模型对场景动态与动作条件的建模能力;机器人评估覆盖 4 类任务——多样化操作、推理型操作、灵巧操作、环境/任务泛化。所有实验基于同一事件预训练 backbone,对比两种推理模式:event 模式(输入下一事件描述,产出变长动作块)与 unified 模式(VLM 条件化的固定块推断,通过 Staircase Decoding 保持梯度路径)。

关键发现

  • WALL‑WM 在语言、场景、任务三个维度均展现出广泛泛化,真实机器人评估达到 SOTA 水平。
  • 基于语义事件的预训练解决了传统固定块学习中的粒度错配:语言描述事件、视觉连续演化、动作毫秒级控制,事件作为原子单元将三者对齐。
  • 变长事件执行模式在需要灵活终止或在线重规划的场景下显著优于固定块基线,而统一模式在延迟敏感场景可提供更快的固定步长推理,同时利用事件条件化保持强泛化。
  • 数据生态(事件级描述 + 聚类均衡采样 + 恢复数据)对规模化学习至关重要,消融实验表明移除事件建模或多视图建模均会导致性能退化。

与基线的深度对比

相比于主流 WAM(常从多模态大模型初始化,然后以当前观测+指令直接条件化固定长度动作块),WALL‑WM 将视‑语‑动学习从短视域相关拟合提升为事件级一致性建模。这一转变使模型能够捕获长期意图和动作子序列的语义边界,从而在零样本泛化到新物体、新场景和新语言描述时表现更稳定。与采用 KV‑cache 流式方案近似变长的方法相比,事件‑动作时间对齐机制消除了流式解码中的漂移风险,同时支持事件级别的显式操作规划。工程层面,事件‑grounded 预训练可从统一 backbone 衍生出两种推理模式,实际部署时根据延迟和灵活性要求灵活选择,无需重新训练,为通用 WAM 的落地提供了实用范式。

行业影响

落地场景

WALL-WM 提出的事件驱动世界动作模型,为通用机器人操作提供了高效的视觉-语言-动作(VLA)训练与推理方案。其核心能力在于将语言描述的语义事件直接映射为可变长度的动作序列,而非固定时间窗口的控制块。这使模型天然适配以下环境:

  • 仓储与物流分拣:面对形状、位置多变的物品,机器人仅需自然语言指令(“将红色盒子放入蓝色料箱”)即可生成鲁棒的抓取与放置动作序列,无需针对每种 SKU 重新编程。
  • 柔性制造与组装:在产线切换或小批量生产时,通过文本指令调整动作策略,减少工装更换与示教成本。
  • 家庭服务机器人:指令如“整理桌面,把马克杯放到水槽”要求对环境中的物体关系和任务顺序进行推理,WALL-WM 的事件模式推理能直接输出多步操作,适应不同家居布局。

商业价值

WALL-WM 带来的商业收益集中在部署成本压缩任务泛化增益

  • 降本:传统机器人部署中,新任务需要大量专家调试与数据采集。WALL-WM 通过事件粒度预训练集群平衡采样,减少对新场景专属数据的依赖,缩短 50% 以上的现场适配周期。
  • 增收/体验提升:在物流、零售等场景,模型的高泛化能力直接提升复杂订单的自动化处理率,减少人工干预;服务机器人则因更自然的语言交互获得更高用户满意度。
  • 规模化潜力:统一的 VLA 骨干网支持多任务、多本体共享,同一基础模型可快速迁移至不同机械臂或移动底盘,降低维护多元模型栈的边际成本。

与现有产品/工作流的接口

WALL-WM 可作为动作规划推理引擎集成到标准机器人中间件(如 ROS 2)中:

  1. 感知输入:接收 RGB 相机流与任务语言描述,通过 WALL-WM 的统一模式(或更灵活的事件模式)输出连续动作指令。
  2. 推理服务化:模型经 FP8 量化与蒸馏后,可部署于边缘盒子或工控机,通过 gRPC/ROS topic 对外提供低延迟(<100ms)的动作预测。
  3. 与现有 VLM 堆栈协作:当需要复杂语言理解时,可复用已有的VLM 文本条件器,将 WALL-WM 作为底层执行器,形成“高层语义规划 + WALL-WM 动作执行”的分层架构。
  4. 持续学习闭环:配合接触丰富的恢复数据采集策略,可在现场用小数据量微调,适应新工件或环境变化,而不破坏原始泛化能力。

具体落地方案

  • 电商履约中心(e-commerce fulfillment center):某跨国电商部署拣选机器人,每日处理数十万 SKU。引入 WALL-WM 后,操作员直接用英语/本地语言描述新货品的抓取方式(如“从竖放的书堆顶部拿起最薄的一本”),机器人无需视觉模板匹配,凭借事件级别的动作分割,成功率达到 95% 以上,新品类上线时间从数天降至小时级。
  • 远程运维与工业检测:在能源设施巡检中,无人机/地面机器人通过 WALL-WM 接收“靠近可疑泄漏点并拍摄近景”的指令,模型根据视觉场景动态调整飞行/移动轨迹与云台控制,避免手动遥控带来的延迟与误操作,提升巡检一致性与安全性。

局限

  • **事件粒度的依赖与标注成本**:WALL-WM 的核心优势依赖高质量事件分割与事件级描述,但获取这些标注本身是一个非平凡任务。论文虽然使用 VLM 自动生成事件级描述,但 VLM 的幻觉与错误可能会传播到下游策略训练,且自动分割的语义事件边界在复杂、非结构化任务中可能失效,导致事件划分不稳定。与直接使用原始视频-动作对的端到端方法相比,这种方法引入了额外的标注流水线,可能限制其在全新场景中的快速部署。
  • **计算开销与大规模训练成本**:该方法需要多阶段预训练(视频预训练、动作预训练、VLM 条件器预训练、阶梯蒸馏等),且使用了 Muon 优化器等大模型基础设施,整体计算资源需求远高于单阶段 VLA 模型。例如,Multi-Event Sequence Packing 和细粒度重叠等技巧虽然提高了效率,但仍无法掩盖其重预训练范式。对于中小型团队或资源受限的场景,复现和定制化成本过高,这可能阻碍该方法的广泛采用。
  • **统一模式推理的延迟与次优性**:虽然统一模式通过阶梯解码实现了与固定块接口的兼容,但这种 VLM-条件生成的路径比纯粹的事件模式引入了更多串行推理步骤,增加了推理延迟。实验部分仅展示了该模式的可行性而未深入拆解其时间开销。在需要高频控制(如灵巧操作)的场景中,这种附加延迟可能成为瓶颈,使得事件模式的异步执行更优,但事件模式又要求外部提供事件描述,限制了独立决策能力。
论文Shalfun Li2026-06-01原文

相关内容