PAIWorld: 用于机器人操作的3D一致世界基础模型
现有世界基础模型作为强大的模拟器,但主要运行在单视图设置中,缺乏机器人操作所需的多视图3D一致性。虽然机器人系统依赖多个摄像头(自我中心、眼到手和腕装)进行策略学习,但当前多视图世界模型仅简单拼接视图令牌,缺乏显式几何推理,导致跨视图物体偏移、深度不一致和纹理错位。作者将这些问题归因于两个缺陷:缺乏显式的视图间通信机制和缺少3D几何先验,并认为同时解决两者是必要且充分的。 为解决这一问题,提出 PAIWorld 框架,通过三个核心组件增强扩散变换器世界模型: 1. Geometry-Aware Cross-View Attention 块:建立视图间的显式通路; 2. Geometric Rotary Position Embedding:将相机射线方向和外部位姿编码到注意力机制中; 3. Latent 3D-REPA:从冻结的3D基础模型中蒸馏3D感知特征,确保3D一致性。 基于 DiT 的世界基础模型,PAIWorld 在机器人操作基准上实现了最先进的多视图3D一致性,在 WorldArena 排行榜上排名第一,在 AgiBot-Challenge2026 排行榜上排名第二,同时支持基于模型的规划、世界动作模型和多视图策略后训练等下游应用。
论文精读
TL;DR PAIWorld 为扩散世界模型注入几何感知跨视图注意力与 3D 先验,根治多视图生成中的物体漂移,在 WorldArena 榜单位居第一。
问题
世界基础模型(WFMs) 作为物理环境的可微分模拟器,正成为机器人策略学习和规划的关键组件。当前研究重心从单一视图生成转向多摄像头场景下的时空一致性建模,以满足机械臂抓取、灵巧操作等任务对多视角联合感知的刚性需求。
现有方法直接将不同视图的视觉 token 沿序列维度拼接后送入 DiT (Diffusion Transformer),隐式期望模型自行学习跨视图对齐。然而,这种设计存在两个根本缺陷:
- 缺乏显式跨视图通信通道:各视图生成过程相互独立,导致物体在不同视图间出现位置漂移、纹理错位;
- 缺乏3D几何先验:模型仅依靠2D像素损失,无法感知相机外参所定义的空间结构,难以维护深度一致性和遮挡关系的物理合理性。
实践中,机器人常配备 egocentric、eye-to-hand、wrist-mounted 等多路相机,这些相机刚性连接且位姿已知,理应共用同一场景的3D表征。简单 token 拼接将几何约束外部化于损失函数,迫使模型仅从数据中“硬记”跨视图规律,低效且无法泛化到未见视角。因此,同时提供跨视图信息通路和3D几何引导成为解决多视图世界模型不一致问题的关键瓶颈。
该挑战在具身智能领域尤为突出:WorldArena 和 AgiBot-Challenge2026 等公开基准已将多视图一致性作为核心评测指标,凸显业界对可落地的多摄像头世界模型的迫切需求。类似问题在 NeRF/3D Gaussian Splatting 的新视角合成中,通过显式三维表征得到缓解,但在生成式世界模型中,由于不具备显式场景表示,必须通过结构设计内化几何推理能力。
行业类比:这与 多模态大模型 中不同模态 token 之间需通过 cross-attention 进行显式交互而非简单拼接的教训一致——缺乏结构化的信息传递机制,模型只能学到统计捷径,而非真实物理约束。
核心洞察
- 多视图世界模型的失败根源在于两条独立但相互依赖的缺陷:缺少视图间显式通信通道,以及缺少 3D 几何先验。单纯串联视图 token 无法约束跨视图的一致性,而仅引入 3D 先验若没有信息交互通路也无法传递约束。PAIWorld 首次明确论证这两点必须并存,并给出联合解决方案:通过几何感知交叉注意力建立通道,同时用几何旋转位置编码和 3D-REPA 提供几何指引,填补了该领域的理论空白。
- 几何旋转位置编码(Geometric RoPE)将相机射线方向与外参直接注入注意力计算,让多视图自注意力天然感知空间关系。与以往仅用标准 RoPE 或学习化位置嵌入不同,这种显式几何编码使注意力权重能反映 3D 邻近性,从而在视图间通信中自然压制几何不一致的生成。这是将几何约束从数据驱动转向模型结构内建的跃迁。
- Latent 3D-REPA 通过冻结的 3D 基础模型提取 3D 感知特征,并将其蒸馏到世界模型的 latent token 中,作为几何先验。不同于常见的图像级或像素级 3D 监督,该方法在扩散 transformer 的 latent 空间进行 token 关系蒸馏,既保留了生成多样性,又强制了跨视图 3D 一致性,实现了高效且不损害原始生成质量的正则化。
方法
PAIWorld 以 Flow Matching DiT 为视频生成骨干,接收多视图图像与对应的相机内外参作为输入,试图生成时空一致的多视角视频。其核心设计可分解为三个紧密耦合的模块:
几何旋转位置编码 (Geometric Rotary Position Embedding)
将相机射线方向和视间相对位姿显式注入注意力计算。通过 Split-RoPE 技术,将射线分量(视角内相对几何)与位姿分量(跨视角空间关系)分别与查询和键的 RoPE 相位绑定,使模型在单视图内感知像素深度,在跨视图间建立三维对应。几何感知跨视图注意力 (Geometry-Aware Cross-View Attention)
替换简单的 token 拼接,引入 Multi-View Self-Attention 块与 Spatial-Concat Self-Attention 变体,为各视图 token 提供显式的信息交换通路。该通路与几何编码协同:注意力偏置基于射线交点与极线约束,迫使模型关注视图间几何相容的区域,从而缓解物体漂移与纹理错位。隐式三维特征蒸馏 (Latent 3D-REPA)
从冻结的 3D 基础模型(如预训练的多视角立体网络)提取三维感知特征,通过 Token Relation Distillation 将跨 token 的几何关系迁移到 DiT 的中间表示层。这一 3D 几何先验 约束了隐空间的结构一致性,即使不可见区域也能在多个视图下维持同一隐式三维表达。
三个组件通过联合训练(训练目标融合流匹配损失与蒸馏损失)形成一个整体:几何位置编码赋予模型三维感知,注意力通路使视图间交换信息,而 3D 蒸馏则充当锚点,防止通信退化为无几何意义的捷径。最终生成的多视图视频在 WorldArena 和 AgiBot-Challenge2026 榜单上取得领先的 3D 一致性指标。
与以往仅简单拼接视图 token 或仅附加几何先验单向注入的方法不同,PAIWorld 同时构建了视图间通信路径和三维几何引导,并证明两者缺一不可,从而将多视图一致性提升至实用级别。
实验
实验设计
PAIWorld 在 动作条件多视角视频生成 任务上评估,采用 WorldArena 与 AgiBot-Challenge2026 两大基准。WorldArena 提供多摄像机机器人操作视频,评测模型在给定动作序列下生成未来帧的跨视角一致性;AgiBot-Challenge2026 侧重更复杂的灵巧操作与环境交互。此外,作者在文本条件多视角生成任务上验证了框架的泛化性,并通过消融实验逐一移除 Geometry-Aware Cross-View Attention、Geometric RoPE 和 Latent 3D-REPA 来量化各组件贡献。训练基于 DiT 架构的视频扩散模型,使用 Flow Matching 目标。
关键发现
PAIWorld 在两个基准上均取得最优多视角 3D 一致性,WorldArena 排名第一,AgiBot-Challenge2026 排名第二。分析表明,仅拼接多视图 token 会导致严重的物体漂移、深度错乱与纹理不对齐,而同时引入跨视图通信通路与 3D 几何先验才能根本解决这些问题。几何感知注意力为视图间提供了显式信息交互,几何 RoPE 编码了相机射线方向与外参,Latent 3D-REPA 则从冻结的 3D 基础模型中蒸馏出 3D 一致的表示。三者缺一不可,联合机制实现了连贯的跨视图生成。
基线对比
与现有 多视图 token 拼接 方法相比,PAIWorld 不仅在定量指标上大幅领先,更在定性可视化中消除了物体撕裂与视角切换时的伪影。消融显示:仅添加跨视图注意力可部分改善一致性,但仍会出现几何不合理的结果;仅引入 3D 先验而缺乏通信通路时,各视图仍会孤立生成。这验证了作者的论断——“通信通路与几何指导必须共存”,缺一则无法将 3D 约束传播至所有视图,导致一致性崩塌。该研究为世界模型的多视图 3D 感知提供了明确的工程指引:显式建模视图间几何关系是构建可靠模拟器的必要条件。
行业影响
落地场景
PAIWorld 的多视图 3D 一致世界模型直接服务于两类高价值场景:
- 机器人操控仿真与策略训练:在多相机设置(腕部、眼部对手、全局俯视)下生成时间连贯、空间对齐的未来视频,用于模型预测控制 (MPC) 的 rollout、数据增强和视觉运动策略的后训练。
- 自动驾驶闭环仿真:环视相机(前视、后视、侧视)需要严格几何一致性来评估规划器,避免纹理漂移或深度错位导致的误判。 此外,在 AR/VR 内容生成、数字孪生 中,任何需要从稀疏多视图输入生成可交互 3D 场景的任务均可受益。
商业价值
- 降本:高保真仿真替代真实机器人试错,大幅减少硬件损耗和人工重置成本。单次真实抓取训练成本约 0.5–2 美元,而 PAIWorld 生成的合成数据成本趋近于 GPU 推理开销。
- 提速:世界模型可并行生成大量交互数据,无需实时物理约束,策略迭代周期从数周压缩至数小时。
- 体验提升:在多视角人机协作或远程操作中,渲染出的 3D 一致画面可提升操作员的空间感知精度,减少误操作。
与现有产品/工作流的接口
PAIWorld 基于 DiT (Diffusion Transformer) 架构,可无缝插入现有机器人学习栈:
- 集成方式:将预训练 PAIWorld 作为冻结的环境模拟器,在训练策略时替换传统物理引擎(如 MuJoCo、Isaac Sim)的可视化渲染管线,直接输出多视图视频预测。
- API/SDK 形态:提供 ONNX/TensorRT 导出,通过 ROS 2 节点或 gRPC 服务接收相机外参、本体感受、动作指令,流式返回多视图 RGB 帧。
- 数据闭环:与标注工具(如 Labelbox)或策略检查点(如扩散策略、ACT)对接,生成反事实示例或困境案例用于课程学习。
具体落地用例
- 仓储拣选机器人:部署在 6 摄像头配置(4 静态货架、1 腕部、1 全局)的拣选站。PAIWorld 接收吸盘动作信号,生成未来 2 秒的多视角视频,供 Q-function 评估抓取稳定性。世界模型可提前识别碰撞风险(如视角一致性丢失表明物体滑动),触发策略回退。
- 自动驾驶端到端 Imitation Learning:在 nuPlan 或 Waymo 数据集基础上,使用 PAIWorld 从多帧历史环视图像和车辆控制信号生成未来轨迹的视觉预测,作为驾驶策略的辅助监督,显著缓解 covariate shift。尤其适用于路口无保护左转等危险场景,无需真实采集失控数据。
局限
- **对 3D 基础模型的强依赖**:PAIWorld 通过冻结的 3D 基础模型(如 DUSt3R)提取特征进行蒸馏,这限制了对 3D 先验的学习自主性,且可能继承外部模型的错误或分布外表现。在机器人操作中,若场景与预训练模型的训练域差异显著(例如非朗伯表面、透明物体),蒸馏信号可能误导生成。此外,训练时需保持额外模型在显存中,增加了资源开销,可能影响实时部署。
- **相机外参的精确标定要求**:几何旋转位置嵌入和跨视图注意力均依赖准确的相机外参(平移和旋转)作为输入。在真实世界的动态环境中,标定误差或多相机系统的轻微偏移会导致深度和纹理对齐错误,对鲁棒性构成挑战。论文未讨论外参噪声下的性能退化,也未提出标定自校正机制,限制了在非受控场景的适用性。
- **训练与推理效率的隐忧**:引入跨视图自注意力块和 3D-REPA 损失后,计算图显著复杂化,而论文未提供与基线模型的训练时长、GPU 内存消耗或推理延迟对比。对于需要实时规划的场景,能否在边缘设备上保持实用帧率存疑。此外,多视图联合生成要求所有视图同时输入,可能无法支持按需流式解码或动态视点添加,影响灵活部署。