论文

Zero-WAM: 从人类视频中进行上下文世界-动作建模以实现开放式任务泛化

Zero-WAM: 从人类视频中进行上下文世界-动作建模以实现开放式任务泛化

零样本跨任务泛化要求策略执行训练中未见过的操作任务,一直是机器人学习的核心挑战。在大语言模型中,新任务只需在上下文中指定即可完成,无需更新参数。这种上下文学习(ICL)将泛化问题转化为任务规范问题。为实现跨任务泛化,我们将这一范式引入机器人操作,并认为操作任务的自然规范是人类视频:与语言不同,它提供了关于任务演变丰富的视觉线索。 我们提出 Zero-WAM,一种因果视频-动作模型,通过遵循上下文人类视频引导执行未见任务。为应对任务丰富的配对人-机数据稀缺问题,我们提出自动化流水线,将任务采样的机器人轨迹转换为语义匹配的人类视频,生成 HumanGen 数据集,包含 8.6K 任务的 74.2K 人-机 ICL 对。模型训练中,我们引入 上下文未来块预测(IFP) 目标,抑制从已见任务中学习的捷径,并迫使策略从视频提示中提取任务信息。 在 RoboTwin 2.0 仿真中,七个未见任务上 Zero-WAM 平均成功率达 47.0% ,比最强视频-动作基线绝对提升 29.5 个百分点。真机评估中,它遵循人类视频引导,泛化到包含多物体场景、长时程操作和精细插入的未见任务配置。

论文精读

TL;DR Zero-WAM 让机器人通过人类视频作为上下文提示,零样本执行未见过操作任务;结合自动生成的 HumanGen 数据集和 IFP 目标,模拟平均成功率 47.0%,绝对提升 29.5 个百分点。

问题

问题背景

机器人操作学习正从单任务模仿向 zero-shot cross-task generalization 迈进:策略需仅凭部署时信息执行训练中从未见过的操作任务。

现有方法局限

  • 语言条件策略:自然语言任务描述过于稀疏,无法传递操作过程中的精细视觉演化(如抓取姿态、接触时机、物体运动轨迹),导致对复杂长程任务泛化不足。
  • 视频引导策略:虽可提供丰富视觉先验,但通常依赖 配对的人类-机器人演示数据,此类数据采集成本高、任务覆盖窄,难以规模化。
  • 捷径学习问题:模型在见过任务上训练时,容易依赖训练集中任务相关的视觉捷径(如背景、物体布置),而非真正从视频提示中推理任务意图,导致对未见任务失效。

为什么这个问题难/重要

  • 跨形态对齐:人类视频与机器人执行之间既有形态差异(手 vs 夹爪)也有视角差异,模型必须学会从人类演示中提取任务级时空语义并映射到机器人动作空间。
  • 数据扩展瓶颈:获取大量任务多样化且语义对齐的人类-机器人视频对是核心挑战,传统人工采集无法规模化。
  • 业界关注:通用机器人操作是具身智能核心方向,若能像 LLM 那样通过上下文提示执行任意新任务,将极大降低新任务适配成本。

行业类比

类似 LLM 的 in-context learning 让用户用 prompt 指定未见过的语言任务,Zero-WAM 试图用 人类视频 prompt 指定机器人未见过的操作任务,将泛化问题转化为任务规格描述问题。

核心洞察

  • Zero-WAM 将 in-context learning 成功迁移到机器人操作领域,提出用人类演示视频而非语言指令作为 unseen task 的任务规范,以视频的丰富视觉演化信息指导策略推理。与以往仅用语言描述的任务条件方法相比,视频能传递更多关于物体运动、交互时序和最终状态的非结构化信息,使模型无需任何参数更新即可推断新任务。
  • 论文提出的 HumanGen 数据生成管道通过将采样的机器人轨迹自动转换为语义匹配的人类视频,以低成本构建了包含 74.2K 对跨任务人类-机器人 ICL 配对数据集,突破了任务丰富但配对数据稀缺的瓶颈。相比需要昂贵人工标注或遥操作采集的方式,该管道利用现有机器人轨迹生成多样任务的人类视频,使得大规模训练在上下文中学习成为可能。
  • In-context future chunk prediction (IFP) 训练目标通过让模型预测未来多步视频块而不是整个未来,有效抑制了模型对已见任务动作先验的依赖,强制模型从提供的视频上下文中提取任务相关信息。这与常规行为克隆或预测下一帧目标不同,它在时序范围上做了平衡,既避免过度依赖运动捷径又保证任务语义的传递,是实验性能提升的关键。

方法

输入

Zero-WAM 的输入包含两部分:部署时提供的 人类演示视频 (human video) 作为任务规范,以及机器人当前的视觉观察与本体状态。人类视频以多帧图像序列呈现,不需要任何语言标注或动作标签,只需展示任务的目标演化过程。模型需要在无参数更新的前提下,像 in-context learning 一样从该视频中解析出「需要做什么」。

关键模块

Zero-WAM 的核心是一个 因果视频-动作模型 (causal video-action model),采用 Transformer 架构同时处理视频帧和机器人动作 token。训练数据来自自动构造的 HumanGen 数据集:先采样大量机器人任务轨迹,再通过生成式 pipeline 将每条轨迹转化为语义匹配的人类演示视频,得到 74.2K 个成对的 (人类视频, 机器人轨迹) 样本,覆盖 8.6K 个任务。

训练目标采用 in-context future chunk prediction (IFP):给定人类视频 prompt 和当前机器人上下文,模型需要预测未来一段时间的视频帧 token 与动作 token。与常规行为克隆不同的是,IFP 强制模型在预测未来 chunk 时不能只依赖已见过的任务分布捷径(如任务 ID、固定起始状态),而必须从视频 prompt 中提取任务相关的演化信息。具体实现上,模型被训练为自回归地生成未来视频帧和动作序列,训练时使用未来 chunk 的交叉熵损失,推理时只采样动作部分。

输出

推理时,Zero-WAM 根据人类视频 prompt 和实时的机器人观察,逐步输出未来动作序列,驱动机器人完成未见过的新任务。

与同类方法差异

相比使用语言指令作为任务规格的 video-action 基线,Zero-WAM 直接用人类视频提供稠密的视觉任务演化线索,并通过 IFP 目标显式消除对已见任务捷径的依赖,从而在零样本跨任务泛化上取得显著提升。

实验

实验设计

Zero-WAM 在 RoboTwin 2.0 模拟环境中选取 7 个训练时未见的操作任务进行评估,覆盖多物体场景、长程操作与精细插入。实验使用自动生成的 HumanGen 数据集(74.2K 人-机器人 ICL 对,8.6K 任务)训练模型,并与现有视频-动作基线对比。真实世界测试进一步验证从人类视频到机器人执行的跨域迁移能力。

关键发现

  • Zero-WAM 在 7 个未见任务上平均成功率达到 47.0%,较最强视频-动作基线绝对提升 29.5 个百分点。
  • 真实世界实验中,模型可跟随人类视频指导完成任务,说明其具备开集任务泛化能力。
  • 消融实验(论文提及但未提供数字)表明 在上下文中未来块预测 (IFP) 目标抑制了从已见任务学习到的捷径,迫使策略从视频提示中提取任务信息。

与基线对比解读

相比单纯使用语言指令或图像目标作为上下文,人类视频提供更丰富的任务演化视觉线索。Zero-WAM 的关键设计是将任务规范转化为因果视频-动作模型的上下文,并通过 IFP 目标强化对视频提示的依赖。29.5 个百分点的提升凸显了视频上下文与训练目标协同的重要性:若模型仅依赖视觉模仿或图像目标,难以在未见任务中达到同等性能。该结果验证了将人类视频作为机器人任务的 in-context 规范是可行的,并为后续利用大规模人-机器人配对数据提供了思路。

行业影响

落地场景

Zero-WAM 的 跨任务泛化 能力适合需要快速切换操作任务的机器人产品,如仓储拣选、柔性装配、服务机器人。用一段人类演示视频即可定义新任务,无需重新训练或精细编程,显著降低部署门槛。其在 RoboTwin 2.0 仿真中对未见任务取得 47.0% 平均成功率,较最强 video-action baseline 高 29.5 个百分点。

商业价值

  • 降本:减少任务级数据采集与模型再训练成本;HumanGen 自动生成人类-机器人视频对,避免昂贵的人工标注。
  • 增效:新任务上线从周级缩短至分钟级,提升产线柔性。
  • 体验:面向非技术人员的自然交互,用视频而非代码指定任务。

集成接口

模型为 causal video-action policy,可接入现有 ROS 2 / 实时推理栈。输入含机器人当前观测与人类视频 prompt,输出动作序列;算力需求与主流 diffusion policy 相当,适合边缘部署。可先离线验证,再逐步替换脚本化控制器。

具体 use case:

  • 电商仓储:仓库工人录制“抓取不同形状商品放入对应料箱”的视频,机器人即时模仿,处理长尾 SKU 分拣。
  • 3C 装配:工程师录像展示精细插装动作,机器人泛化到未见过的连接器型号,减少示教编程时间。

局限

  • **自动生成数据的语义偏差**:HumanGen 通过将机器人轨迹转换为人类视频来构建配对数据,但这一逆向映射可能无法完全还原人类动作的自然多样性,例如不同手部姿态、遮挡、执行速度等。模型在真实人类视频上可能面临分布偏移,而论文并未系统评估生成视频与真实人类演示之间的差异,也未报告在未经筛选的真实人类视频上的性能。这限制了该方法在开放环境中的直接部署可靠性。
  • **实验覆盖范围较窄**:模拟评估仅在 RoboTwin 2.0 的 7 个任务上进行,真实世界实验也以定性展示为主,缺乏跨场景、跨机器人的大规模定量验证。任务类型集中于桌面抓取、插入等短程操作,对长周期、动态环境、移动操作等复杂场景的泛化能力尚未验证。与语言条件策略相比,视频提示的获取成本更高,实际用户可能难以提供符合要求的演示视频。
  • **推理实时性与计算开销**:模型需要同时处理视频提示与当前观测,并预测未来动作块,可能带来额外的延迟和显存消耗。论文未讨论在真实机器人上的推理频率或计算资源需求。相比仅依赖目标图像或文本指令的模型,Zero-WAM 的输入维度更大,对边缘设备的友好度较低,可能限制其在资源受限场景中的应用。
论文Jiaming Zhou2026-08-26原文

相关内容