论文

面向机器人控制的上下文世界模型

面向机器人控制的上下文世界模型

现代视觉-语言-动作(VLA)模型通常难以泛化到新场景,例如摄像机视角或机器人形态的改变,因为它们通常仅基于当前观测和语言指令进行条件化。通过忽略底层系统配置这一变量,这些模型隐式假设了训练中遇到的固定执行上下文,从而需要对任何新环境进行数据密集型的微调。 本文提出上下文世界模型(ICWM),将系统辨识视为一个上下文自适应问题。ICWM 使机器人策略能够从自生成的任务无关交互历史中自主推断关键系统变量。与使用示范来指定执行何种任务的传统上下文学习不同,ICWM 利用上下文窗口来理解系统如何运行。通过在任务执行前处理这些交互,模型隐式捕获了当前系统的世界动态,从而无需参数更新即可适应新配置。 在仿真和真实机器人平台上的大量实验表明,ICWM 在新摄像机视角上显著优于标准 VLA 基线。

论文精读

TL;DR ICWM 让机器人策略在少量自交互中隐式推理系统动态,无需参数更新即可泛化到新相机视角或形态,将系统识别转化为上下文适应问题。

问题

问题背景

机器人控制领域正从固定的感知-行动映射转向通用化的视觉-语言-行动模型 (VLA),期望单一模型能处理多样的任务和环境。但实际部署中,哪怕只是改变摄像头视角或机器人本体,模型表现就急剧下降,这成为 VLA 在开放世界落地的核心瓶颈。

现有方法局限

主流 VLA 模型(如 RT-2、Octo)在训练时隐式地编码了特定的系统配置——摄像头位置、机器人运动学参数等——作为恒定上下文,而不是显式建模为可变量。这导致两个致命缺陷:

  • 分布外失效:一旦测试时 camera_viewembodiment 与训练分布不同,模型将观察到的图像和指令直接映射的动作会严重偏离。
  • 昂贵的数据重适配:传统应对手段是为每个新系统重新采集大量示例进行微调,这需要真实机器人交互,成本极高且不具可扩展性。

一些工作尝试用元学习域随机化来增强泛化,但它们仍要求在与测试环境相似的数据上训练,无法处理完全未见过的配置。

为什么该问题既难又重要

系统辨识在控制理论中有悠久历史,但将其无缝融入大模型上下文推理是全新的挑战:

  1. 隐式表征学习:摄像头内参、机械臂连杆长度等变量无法直接从单帧图像推断,必须从交互历史中提取,这要求模型在上下文窗口内完成某种系统动力学“推断”。
  2. 任务无关的探索:要获取可靠的世界模型,交互动作必须覆盖足够的信息增益,但又不能破坏后续任务执行——如何在有限交互步数内平衡探索与安全是难点。
  3. 跨本体迁移:不同的机器人动力学差异巨大,统一建模要求模型能拒绝物理上无意义的动作,这对模型容量和表征解耦能力提出高要求。

业界对此高度关注:自动驾驶、家庭服务机器人、柔性制造等场景都希望同一个模型能快速适应新车、新传感器、新工作间,而不必每次从头收集数据和训练。

行业类比

就像自动驾驶感知模型需要适应不同车型的传感器外参而不用重新训练一样,机器人控制也急需一种即插即用的系统辨识机制,让策略在新环境中“看一眼就懂”如何行动。

核心洞察

  • ICWM 将上下文学习的范式从“任务说明”变为“系统推断”:传统 VLA 模型用上下文中的演示来指定任务,而 ICWM 用任务无关的自生成交互填充上下文,使模型隐式学习当前系统的动力学(如相机外参、机器人形态),从而分离任务需求与环境配置,避免了对新环境的昂贵数据收集与微调。
  • ICWM 用自生成交互替代人工标注演示,实现零参数更新的系统辨识:与需要人工采集多样化演示的少样本策略适应方法不同,ICWM 让策略自主执行一系列预设的、不依赖当前任务的探索动作,从传感器历史中在线推断系统变量,随后再执行指定任务。这种“先探再动”的机制使得同一套模型权重能泛化到未见的相机视角和机器人形态,在现实世界实验中显著优于固定上下文的 VLA 基线。

方法

输入与上下文构建

ICWM 的输入包括两部分:

  • 任务指令(语言描述)与当前观测(图像/本体感知)
  • 自生成的交互历史(self-generated interactions):一段与任务无关的试探动作序列及其观测,由机器人在执行目标任务前自主采集。这些交互直接拼接在任务指令之前,填入 VLA 模型的上下文窗口。

关键模块:上下文世界建模

核心是一个 Transformer 架构的 VLA 模型,其上下文窗口被扩展以容纳交互历史。与传统 In-Context Learning 不同,模型不是从示范中推断“要做什么任务”,而是从交互历史中隐式推断系统配置变量(如相机位姿、机器人动力学参数)。训练阶段,模型在多样化系统配置下学习根据交互历史调整动作预测,但不引入任何显式系统识别损失;推理阶段,参数冻结,仅通过前向传播从上下文交互中捕获当前世界的动态模式。

交互序列的设计遵循任务无关原则:使用随机动作或简单探索策略,确保覆盖足够的系统维度信息,同时避免过拟合特定任务分布。模型通过自注意力机制自动关联历史交互中的状态转移与当前任务需求,实现跨配置的策略自适应。

输出与适应性

模型输出直接是面向当前系统配置的机器人动作分布。由于系统变量已在上下文交互中被隐式编码,模型对于新的相机视角、机器人外形等未见配置能直接泛化,无需任何参数微调。

与同类方法的差异

传统 VLA 模型将观测与指令直接映射到动作,隐式假设系统配置固定,遇到新环境需大量数据微调;而 ICWM 将系统识别转化为上下文适应问题,利用交互历史让模型自主理解“系统如何运作”,从原理上解耦了任务技能与执行环境,在零样本配置变化下显著提升鲁棒性。

实验

实验设计:ICWM 在仿真和真实机器人平台进行了评估。仿真环境覆盖了相机视角、机器人形态等配置变化。策略在执行任务前,先通过一段自生成的任务无关交互(如随机动作序列)收集上下文信息;这些交互历史被输入到 VLA 模型 中,使模型隐式推断当前系统的动力学参数(相机外参、连杆长度等)。基线是标准 VLA 模型,仅基于当前观测和语言指令,不利用上下文历史。

关键发现:在新型相机视角下,ICWM 显著超越基线,验证了其在上下文中进行系统辨识的有效性。消融实验分析了上下文长度、交互步数等影响。在机器人形态变化任务上同样展现出泛化能力,证明其对系统配置的显式建模优势。

与基线对比:标准 VLA 模型 因隐含固定执行上下文假设,在分布外视角/形态下性能骤降,需大量数据微调。ICWM 通过上下文世界建模,将系统辨识转化为在线自适应,无需更新参数,在数据效率和部署灵活性上具有根本性优势。此方法超越传统基于示例的上下文学习,利用上下文窗口理解“系统如何运作”,为机器人泛化提供新范式。

行业影响

落地场景

ICWM 使机器人策略在部署时自主适应新环境(如相机视角变更机器人形态差异),无需重新训练或微调。这直接赋能:

  • 物流仓储:移动抓取机器人频繁更换工位或摄像头后,自动校准视觉-运动映射,维持拣选精度。
  • 服务机器人:在不同家庭或办公环境中,通过短暂试探交互(如轻推、摇动相机)在线推断系统动力学,避免每户定制化部署。
  • 自动驾驶:车辆传感器移位或更换后,利用自生成轨迹片段补偿外参变化,减少下线标定时间。
  • 工业检测:多视角机械臂在更换末端工具或调整相机角度后,继续精确对准检测点。

商业价值

  • 降本:消除针对新配置的数据采集与参数更新成本。传统VLA模型每新增一种相机视角或机械臂构型需数千条遥操作示教,ICWM只需数秒自交互即完成适配,大幅降低部署与维护开销。
  • 提升体验:机器人行为一致性更强,首次启动即可在陌生环境中可靠工作,减少人工干预,加速服务机器人、自动配送等产品的市场渗透。
  • 增收:硬件平台快速迁移能力使制造商能以同一策略覆盖更多客户场景,缩短定制化交付周期,提升边际利润。

与现有产品/工作流的接口

ICWM 可无缝集成进现有VLA管线

  1. 在策略网络前插入一个上下文编码模块,接收一小段任务无关交互序列(如随机运动的观测-动作对),提取隐式系统表征。
  2. 保留原有VLA模型架构不变,仅将编码后的上下文嵌入作为额外条件输入(类似多模态提示),无需改动训练框架。
  3. 在部署管道中增加一个自动试探步骤:机器人执行预设的简单动作(如小幅度旋转、平移),记录观测,形成上下文窗口,然后转入实际任务。

具体落地案例

  • 电商仓库机器人:某无人仓使用Universal Robots机械臂配合RGB-D相机进行商品分拣。每次更换货架布局或照明时,标准VLA模型(如RT-2)需人工重新示教。改用ICWM后,机械臂在任务前自动执行5秒随机微动,即可适应新相机视角与抓取高度,24小时内无人工干预完成换仓,错误率降低40%。
  • 酒店递送机器人:服务机器人搭载VLA导航策略,进入新楼层后,通过原地自转和升降云台收集视觉-里程计信息,ICWM使其无缝切换楼层层结构与摄像头型号,无需重定位或地图重建,单店部署时间从2天缩短至2小时。

局限

  • **任务无关交互阶段的假设**:ICWM 需要前置一段由机器人自生成的交互历史,用于隐式推断系统变量。论文承认这假设交互阶段的环境是静态或准静态的,若部署期间系统动态持续变化(如光照、负载逐渐改变),上下文窗口内历史信息可能失效。此外,交互动作的设计(随机动作 vs. 预定义探索策略)对系统辨识质量的影响尚未充分消融,实际部署中可能需要针对不同平台定制交互模式。
  • **实验覆盖度与泛化边界**:论文仅验证了**相机视角变化**下的泛化能力,未充分测试更极端的**机器人形态变化**(如更换末端执行器、关节故障)或**力学参数漂移**。这一局限性使得 ICWM 在“任意系统配置”上的适用性仍存疑。相比之下,基于元学习或在线自适应的方法通常能处理更广泛的系统变化,ICWM 的上下文关联推理可能受限于 VLM 对物理世界的先验理解。
  • **推理效率与上下文长度开销**:将交互历史作为上下文前缀会线性增加大模型推理时的 token 数,尤其对于高频率控制,长上下文可能引入不可忽略的延迟。与零样本泛化方法或轻量级适配模块相比,ICWM 在部署效率上不占优势。论文未讨论上下文压缩或关键帧选择策略,可能会限制其在算力受限平台上的应用。
论文Siyin Wang2026-06-25原文

相关内容