论文

具备细粒度具身交互的多智能体第一人称世界模型

具备细粒度具身交互的多智能体第一人称世界模型

第一人称世界模型(egocentric world model)以智能体动作为条件预测第一人称观测,但多数工作只关注单一智能体。真实的具身场景往往涉及多个智能体在同一共享环境中行动与交互,而现有 多智能体世界模型 多依赖移动、相机控制或离散指令等粗粒度动作,细粒度具身交互仍未被充分探索。 本文将多智能体第一人称世界建模定义为:多个智能体在共享世界中通过细粒度动作交互时,同步生成各自的 ego stream。这一设定要求满足三点: 1. 跨视角动作一致性; 2. 共享环境一致性; 3. 交互引发的状态更新能够一致地传播。 为此提出 ME-World(Multi-agent Egocentric World Model):在共享 token 序列中联合去噪多条 ego stream,让每条流以所有智能体的目标视角位姿为条件,并借助共享环境记忆为生成提供 grounding。 实验在真实与合成多智能体数据上进行训练与评估,并提出面向共享世界一致性的指标,覆盖环境一致性、更新一致性与身份一致性。结果表明,ME-World 在共享世界一致性、动作控制、身份保持与视频质量上均优于现有方法。

论文精读

TL;DR ME-World 提出多智能体自我中心世界模型,通过联合去噪多个 ego 流并共享环境记忆,实现对细粒度具身交互的建模,在共享世界一致性、动作控制与身份保留上优于现有方法。

问题

问题背景:当前具身智能与视频世界模型发展迅速,第一人称世界模型能够基于动作预测未来观测,为规划与仿真提供支撑。

现有方法局限:主流模型仍以单智能体为主,多智能体世界模型则普遍采用粗粒度动作,如整体运动、相机控制或离散指令。这类动作表示无法刻画细粒度具身交互,例如手部抓取、工具操作或多人协作中的传递动作。同时,共享环境状态在多视角间缺乏一致建模,导致生成结果违背物理常识或出现视角矛盾。

为什么这个问题难/重要:多智能体自我中心世界建模要求同步生成多条第一人称视觉流,并满足三个关键约束:跨视角动作一致性 和 共享环境一致性 以及 交互状态更新的传播一致性。任务难点在于模型必须理解多智能体之间的行为耦合与物理因果关系,而不只是生成独立视频。此方向对协作机器人、多车自动驾驶仿真和具身多智能体策略学习具有重要价值,但现有基准与评价指标均未覆盖这些需求。

行业类比:类似于多智能体强化学习中的集中训练分散执行,需要一个全局一致的世界模拟器来支持多个智能体的决策与交互。

核心洞察

  • 多智能体自视角世界建模的核心是将多个同步第一人称视图生成视为一个共享 token 序列下的联合去噪问题,而非独立预测。现有方法通常采用粗粒度动作(如移动、相机控制或离散命令),无法处理细粒度交互引发的全局状态变更。ME-World 通过在共享 token 序列中联合去噪多个自视角流,并结合共享环境记忆与跨视角动作条件,确保碰撞、物体传递等交互事件在多个视角中保持空间和时间一致。这为多智能体具身预测提供了一种新的建模范式。
  • 细粒度动作条件下的多智能体世界模型需要同时满足动作控制精度和共享环境一致性,而二者往往相互制约。ME-World 的贡献不仅在于模型结构,还在于引入了环境一致性、更新一致性和身份一致性指标,首次量化评估多智能体自视角生成中的共享世界一致性。这套评估体系使不同方法可以在统一标准下进行比较,推动了该任务从定性演示走向可验证的工程化研究,也为后续工作提供了可复用的基准工具。

方法

输入与建模

ME-World 的输入为多个智能体在同一共享世界中的同步第一人称视频流,以及各自执行的 细粒度 embodied 动作(如手部操控、物体交互)。模型将这些多视角流拼接为一个 共享 token 序列,统一交给联合扩散去噪网络处理,而非各智能体独立建模。

关键模块

  1. 联合多智能体生成:所有 ego 流在共享 token 空间中同时去噪,隐式学习跨视角一致性。
  2. 共享动作条件:每个 agent 的预测不仅基于自身动作,还条件于 所有 agent 的目标视角位姿,使生成的未来帧能反映其他智能体动作引发的环境变化。
  3. 共享环境记忆:引入可学习的记忆模块,存储场景级状态(如物体位置、被交互物体的更新),在生成过程中查询并更新,确保交互引起的状态传播在各视角一致。
  4. 训练目标:使用扩散去噪损失,同时通过新提出的 共享世界一致性指标(环境一致性、更新一致性、身份一致性)辅助评估与优化。

输出与差异

输出为多个 agent 未来同步的第一人称视图序列。与现有多智能体世界模型依赖 locomotion、camera 等粗粒度动作不同,ME-World 通过共享 token 序列与共享环境记忆首次实现细粒度交互下的联合世界建模。

实验

实验设计

论文在 真实与合成多智能体数据集 上训练 ME-World,并与四类基线对比:多视图视频生成、单智能体世界模型、通用世界模型、多智能体世界模型。引入三项 共享世界一致性指标:环境一致性、状态更新一致性、身份一致性。同时评估动作控制、身份保持、视频质量等标准指标。

关键发现

ME-World 在所有共享世界一致性指标上较基线有稳定提升,验证了 联合去噪共享 token 序列、全智能体目标视角位姿条件化 与 共享环境记忆 能够有效捕获跨视角一致性并传播交互状态更新。

深度解读

现有方法依赖粗粒度动作(如导航、相机控制或离散指令),无法建模细粒度交互(如手部动作、物体操作);且多视图生成方法通常独立生成各视图,缺乏共享环境约束。ME-World 通过单一共享 token 序列联合生成多 ego 流,并显式维护环境记忆,从根本上避免了视图间不一致与状态更新丢失。

行业影响

落地场景

ME-World 可直接用于多智能体具身仿真:电商仓储多机器人协同搬运、自动驾驶多车交互、VR 多人协作培训等。其核心能力是为每个智能体同步生成第一人称视频流,并保证共享环境的一致性,适合需要多视角细粒度动作预测的场景。

商业价值

  • 降本:减少多智能体系统的实机测试与数据采集成本,用生成式世界模型替代部分物理试验。
  • 增收:为内容平台提供多用户一致的互动视频生成,支撑元宇宙、社交游戏等新体验。
  • 体验提升:在远程协作、机器人遥操作中提供高保真多视角预览,提升操作安全性。

跟现有产品/工作流的接口

ME-World 可作为模拟器插件或数据增强模块集成:

  • 与 NVIDIA Isaac Sim 等机器人仿真器结合,输出高真实感多智能体视频。
  • 作为多智能体策略训练的环境生成器,为 MARL 提供无限多样的交互场景。
  • 接入现有世界模型框架(如 Genie、UniSim)扩展多智能体支持,输出同步多视角流。

具体 use case:

  1. 电商仓储机器人:多台 AGV 协同拣选,用 ME-World 预测不同控制策略下的第一人称视角,快速评估碰撞风险与协作效率。
  2. 自动驾驶仿真:为多辆自动驾驶汽车生成各自驾驶视角的未来视频,训练车辆预测模型并测试复杂路口交互。

该模型降低了多智能体世界建模的门槛,为需共享环境一致性的产品提供了新的技术基座。

局限

  • 数据规模与多样性限制:论文采用真实和合成多代理数据,但合成数据存在 domain gap,真实数据采集成本高且场景有限,导致模型对未见交互类型的泛化能力存疑。此外,细粒度动作的定义(如关节级操控)可能依赖特定传感器与标注,限制了方法在一般具身平台上的适用性。
  • 计算复杂度与可扩展性:ME-World 联合去噪多个 ego streams 于单一 token 序列,随着代理数量增加,序列长度和注意力复杂度呈平方增长,难以扩展到大规模多代理场景(如群机器人、多人 AR/VR)。共享环境记忆的容量和更新机制也需进一步优化以支持长时间交互。
  • 评估指标局限:提出的 shared-world consistency 指标虽然针对环境、更新和身份一致性,但仍是基于模型的间接评估,与人类真实感知可能不完全对齐。同时缺乏与更广泛世界模型(如视频预测模型)在标准 benchmark 上的对比,说服力有限。
论文Dahyun Chung2026-10-08原文

相关内容