论文

InternW0: 面向高效真实世界交互的基础物理世界模型

InternW0: 面向高效真实世界交互的基础物理世界模型

物理智能不只是预测世界将如何演化:预测还必须在世界持续变化时保持可执行性。我们提出 InternW0,这是上海 AI Laboratory 的 InternW 物理世界模型系列的首个实例,围绕全模态接口、异步多频处理,以及部分观测与外部影响下的局部物理建模构建。 InternW0 采用非对称的 video–action 架构 与 flow matching,联合学习未来视觉动态与连续机器人控制。高容量 video expert 提供更长时域的预测上下文,轻量 action expert 则以更快时间尺度运行。它无需为每次动作更新重新生成未来,而是复用 layerwise K/V,并通过 observation-conditioned context routing 将其适配到新观测状态。领域专用接口与 soft prompts 支持异构具身,而用于富接触操作的 contact-aware 后训练 引入力与触觉信号。 我们在约 7,200 小时 的异构机器人与第一人称数据上训练 InternW0,其中包括 EgoLab,一个 275 小时的真实实验室第一人称数据集。评估覆盖仿真基准与真实科学任务,包括 15 阶段 的 metal–organic framework 合成流程,以及面向通用定量移液的 5 阶段接触与力感知灵巧操作。 这些结果推进了可扩展、异步且科学原生的物理世界模型,迈向通用而高效的真实世界交互。

论文精读

TL;DR InternW0 是上海AI实验室推出的首个物理世界基础模型,通过异步视频-动作架构与 K/V 缓存复用,同时预测未来视觉动态并输出高频机器人控制,在 15 阶段 MOF 合成等真实科学任务中实现高效闭环操作。

问题

问题背景

物理智能领域正从单纯预测视觉动态转向强调预测的可操作性,核心诉求是让模型在真实环境中持续闭环控制,而不是离线生成未来视频。

现有方法局限

主流做法通常将世界模型与策略模块分离:先用视频预测模型生成未来帧,再额外训练策略网络读取这些预测。这带来两个突出局限:

  • 推理效率低:每次动作更新都需要重新生成整个未来窗口,前向计算开销大,难以支撑真实机器人所需的高频控制(通常 ≥ 20 Hz)。
  • 物理信号缺失:多数模型假设完整观测、无外部干扰,且未显式建模力觉、触觉等接触信号,导致在接触丰富任务(如精密移液)中表现不稳定。

为什么这个问题难/重要

真实世界交互具有异步多频率特性:视觉预测需要较长视野(秒级),而控制指令必须在更短周期(毫秒级)内更新,传统同步架构难以平衡两者。同时,部分可观测性、外部扰动和异构 embodiment 进一步增加建模难度。业界对 embodied AI 基础模型需求迫切,但高效、可扩展的物理世界模型仍稀缺。InternW0 的非对称视频–动作架构与 K/V 重用策略显示,通过分离长程上下文与轻量控制专家,并在新观测到来时路由历史缓存,可在保持预测质量的同时显著降低每步推理成本,为实时闭环提供了可落地的工程路径。

行业类比

类似 LLM 推理中利用 KV cache 避免自回归生成时重复计算历史 token,InternW0 在物理交互中复用层wise K/V 以支持高频动作更新,将基础模型效率优化思路迁移到具身智能领域。

核心洞察

  • InternW0 的核心创新在于非对称 video-action 架构与异步多频处理:高容量 video expert 负责长时程预测,轻量 action expert 以更快频率输出控制,并通过 observation-conditioned context routing 复用层间 K/V,而不是每次动作更新重新生成未来。这与多数 world model 的“预测-规划”串行范式不同,将预测与控制解耦,显著降低 critical-path 延迟,使物理世界模型在真实闭环中可部署。
  • InternW0 引入 contact-aware post-training,将力觉与触觉信号纳入联合动作-接触预测,使模型不仅预测视觉动态,还能感知接触约束。与仅从视频学习的世界模型相比,这种多模态反馈让模型在接触丰富操作中具备物理一致性,支撑诸如 5 阶段定量移液、15 阶段 MOF 合成等真实任务。配合 EgoLab 第一人称实验室数据集,InternW0 展示科学实验场景下的可扩展性。

方法

输入

多模态观察(RGB 视频流、机器人状态、任务指令、外部影响力),且允许部分观测下的局部物理建模。

关键模块

  1. 不对称视频-动作架构:高容量视频专家提供长程预测上下文,轻量级动作专家在更快时间尺度上输出控制。
  2. 流匹配(flow matching):在潜在动态中联合学习未来视觉动态与连续动作生成。
  3. 异步双工推理:视频专家低频更新预测,动作专家高频执行;通过层间 K/V 缓存复用与观察条件路由,将新观测注入既有预测,避免每次动作更新重新生成未来。
  4. 软提示与域接口:域特定接口 + 软提示支持异构机器人实体(单臂、双臂、灵巧手等)。
  5. 接触感知后训练:联合动作-接触预测,融合力/触觉信号改善接触丰富操作。

输出

未来视觉动态预测 + 实时连续控制动作;训练使用约 7200 小时异构数据(含 EgoLab),混合监督(预测 + 控制)与域混合采样。

差异点

相比主流世界模型重新生成未来用于规划,InternW0 通过异步专家与 K/V 缓存路由将预测与行动解耦到不同频率,实现高效闭环执行。

实验

实验设计

  • 训练数据:约 7,200 小时异构机器人+自我中心数据,含 EgoLab 275 小时真实实验室数据。
  • 评估:模拟基准(单臂、双臂 RoboTwin 2.0-Full / RoboTwin 2.0-Clean2Random)+ 真机湿实验室任务(15 阶段 MOF 合成、5 阶段接触感知移液)。
  • 架构:非对称视频-动作专家 + flow matching,视频专家提供长期预测上下文,动作专家轻量高频运行。

关键发现

  • 异步双工推理 复用 layerwise K/V 并通过 observation-conditioned context routing 适配新观测,无需每次动作更新重新生成未来,降低关键路径延迟、提高策略更新率。
  • 接触感知后训练 联合动作-接触预测,引入力/触觉信号,提升接触丰富操作(如移液)。
  • 软提示支持跨异构 embodiment 预训练。

与基线对比解读

  • 相比需要为每个动作重新生成未来视频的物理世界模型(如 UniPi 类),InternW0 的 K/V 复用机制将预测成本降为接近增量更新,更适合真实世界闭环。
  • 摘要强调 predictions must remain actionable as the world continues to change,设计目标不是单纯视频预测,而是将视觉预测直接耦合到可执行动作。
  • 未给出具体 success rate / latency 数值,需看正文 Efficiency 部分;方法层面体现效率作为物理智能的特性。

行业影响

落地场景

InternW0 适合需要实时交互 与长时预测 的物理场景,例如医药研发实验室 的 MOF 合成与精密移液、电商物流仓库 的抓取装箱,以及制造质检 中力控装配。这些任务要求模型在部分观测和外部干扰下保持动作有效性,同时具备接触感知。

商业价值

核心价值在降低迭代与部署成本。通过非对称视频-动作架构 与观测条件上下文路由 复用层间 K/V,避免每次动作更新都重新生成未来视频,显著降低推理延迟,提升策略频率。对接触丰富任务 (如定量移液、力觉装配) 可减少人工示教与调参,缩短研发周期;同时预测未来世界动态有助于提前规避异常,降低事故停机损失。

与现有产品/工作流的接口

InternW0 可作为通用物理世界预训练模型 接入现有机器人栈:保留上层任务策略与运动规划器,模型输出未来视觉动态 和控制信号的 latent 上下文,通过软提示 适配不同本体。其异步双工推理 允许视频专家低频更新、动作专家高频执行,适合与 ROS 2 等实时框架集成;接触感知后训练 可直接融合力/触觉传感器数据,替代手工设计的力控特征模块。相比传统视频预测模型逐帧重生成未来,该架构的缓存复用机制降低了与现有闭环控制系统的集成成本。

局限

  • 论文在跨 embodiment 泛化上的验证仍有限:虽然通过 soft prompts 和 domain-specific interfaces 支持异构本体,但真实世界实验仅覆盖双臂和灵巧手两类平台,模拟基准也以单臂/双臂为主。对于更广泛的移动机器人、四足或人形机器人,异步双工架构和 observation-conditioned context routing 能否保持高效与稳定尚未得到充分验证。此外,EgoLab 数据集主要为实验室自我中心数据,真实世界多样性仍显不足,可能限制模型在开放环境中的泛化能力。
  • 异步多频推理和 K/V 复用虽然降低了动作更新的计算开销,但系统复杂度显著增加:视频专家和动作专家的非对称设计、layerwise K/V 缓存管理、以及不同频率的同步机制,对工程实现和资源调度要求较高。论文讨论了 critical-path latency 和 policy update rate,但未详细分析视频专家在高分辨率长时预测下的内存占用和能耗,也未给出在边缘设备或嵌入式场景中的可行性评估。这限制了方法在资源受限部署中的实用性。
  • contact-aware post-training 需要额外的力觉和触觉信号,这类数据的采集成本高、标准化困难,尤其对于精密操作任务,高质量触觉数据往往稀缺。论文在真实世界接触丰富任务(如定量移液)上展示了效果,但依赖特定的传感器配置和后训练流程。若不具备相应传感条件,接触感知能力的迁移和泛化可能受限,这削弱了该方法在通用物理世界模型中的普适性。
论文Jisong Cai2026-09-23原文

相关内容