WEAVER: 更优、更快、更长——面向机器人操控的有效世界模型
世界模型 (World Models, WMs) 作为学习型模拟器,对机器人领域具有深远影响——包括策略评估、策略改进和测试时规划——且仅需有限真实世界交互。为解锁这些下游能力,WM需同时满足三个要求: 1. 逼真性:生成的模拟轨迹与真实世界相关。 2. 一致性:长期模拟轨迹保持连贯。 3. 效率:快速生成模拟轨迹。 我们提出 WEAVER (World Estimation Across Views for Embodied Reasoning) 架构,首次同时实现上述三项目标,在机器人操控任务上取得最优结果。WEAVER 是一种多视角 WM,通过流匹配损失 (flow-matching loss) 训练以预测未来潜变量和奖励值。我们提取了模型架构、记忆机制和预测目标的关键设计决策,这些决策解决了先前方法难以应对的长期动态操控任务。 在真实机器人实验中,WEAVER 在以下方面展现了有效性: - 策略评估:真实世界成功率相关系数 ρ=0.870 - 策略改进:基于 π{0.5} 机器人基础模型,真实世界成功率提升 38% - 测试时规划:相比先前 WM,真实世界成功率提升 14%,且速度提升 5-10 倍 此外,在分布外场景下 WEAVER 性能优于先前 WM。代码、模型和视频见 https://arnavkj1995.github.io/WEAVER/。
论文精读
TL;DR WEAVER 是一种多视图世界模型,通过流匹配损失同时实现高保真、长时一致性及快速推理,在真实机器人操作中显著提升策略评估、改进与规划效果。
问题
机器人操作领域正积极利用世界模型(World Model)作为学习到的仿真器,以减少对昂贵物理交互的依赖,赋能策略评估、改进与测试时规划。然而这类下游应用要求世界模型同时满足三个严苛条件:高保真度(模拟轨迹与真实高度相关)、长程一致性(长时间rollout仍连贯)、高效推理(生成速度快)。
现有方法难以兼顾三者。基于像素的视频预测模型(如 SVG)虽保真度较高,但推理速度缓慢,且长序列生成时误差累积明显;基于潜在状态的动态模型(如 Dreamer 系列)虽推理更快,但保真度不足,长期预测容易发散。多数模型未针对多视角输入和高维动作空间设计,导致在真实机器人操作任务中顾此失彼——不是生成质量差、就是推理太慢、或是预测在长程任务中崩溃。
这一问题的核心挑战源于三要素间的内在冲突:高保真建模需要高容量模型和精细损失函数,加剧计算负担;保持长期一致性要求有效的记忆与误差修正机制,否则状态估计会逐步漂移。在长程动态操作任务(如持续数分钟的精细操控)中,细微误差逐帧累积最终导致完全失真的仿真,使下游应用失效。业界对世界模型的关注持续升温,因为它能以极低真实交互成本实现策略迭代,对通用机器人操作的规模化至关重要。这类似于自动驾驶中的世界模型需求——必须同时提供高保真的动力学预测、长距离轨迹一致性以及满足实时控制周期的推理速度,任何一个维度缺失都将导致规划失效。
核心洞察
- 多视图世界模型结合流匹配损失同时解决长时域一致性与高保真难题:先前世界模型常使用单视图观测或扩散模型,导致长时域轨迹失准或推理缓慢。WEAVER 从多视角图像中学习共享的潜在表征,并以 flow-matching 目标直接建模从噪声到未来潜在状态的映射,避免了扩散模型的迭代采样和单步预测的累积误差,在长时域操作任务中实现了轨迹连贯性与真实成功率的强相关性(ρ=0.870)。
- 通过 KV 缓存与噪声调度的协同设计,WEAVER 将世界模型推理效率提升 5-10 倍而不牺牲生成质量:许多现有世界模型受限于逐步自回归推理的重复计算,无法满足测试时规划对速度的苛刻要求。WEAVER 在 Transformer 解码器中引入 KV 缓存,复用先前时间步的注意力状态,同时调整推理噪声调度让早期生成辅以较大噪声以防止错误累积。这种系统级的加速策略使得世界模型首次能在真实机器人硬件上运行策略改进与实时规划。
方法
输入:多视角感知与动作序列
WEAVER 接收多个相机视角的 RGB 图像、机器人关节状态以及执行的动作序列作为输入。这些异构信号经过动作适配器(Action Adapter) 对齐到统一表示空间,为后续动态建模提供紧凑的观测-动作 embedding。
关键模块:多视图潜空间动态预测
- 多视图编码器:将不同视角的图像分别编码为潜在向量,通过交叉注意力融合成全局潜在状态 (z_t),确保空间信息有效整合。
- Flow-Matching 世界模型:核心生成模块采用连续归一化流(Flow Matching) 损失,从当前潜在状态 (z_t) 和动作 (a_t) 直接预测未来潜在状态 (\hat{z}_{t+1}) 与即时奖励 (\hat{r}_t)。与扩散模型相比,Flow Matching 在长序列生成中具有更好的数值稳定性和更快的采样速度。
- 价值估计器:在世界模型内部集成价值网络,基于预测的潜在轨迹输出状态价值,无需接入外部环境即可支持高效规划。
输出:高速、长时域一致的模拟轨迹
世界模型可生成数百步的潜在状态序列和奖励序列,供给下游应用:
- 策略评估:通过比较模拟 rollout 成功率与真实环境结果,定量衡量策略性能。
- 策略改进:在无真实交互下,利用模拟轨迹构造偏好数据集微调策略。
- 测试时规划:基于模型预测控制(MPC)框架,在推理时用 KV Cache 加速 rollout,实现 5–10 倍于先前方法的速度。
与同类工作的关键区别
WEAVER 通过多视图 Flow Matching 架构 + KV Cache 推理优化首次同时在保真度、长时一致性和推理效率三个维度上超越现有世界模型(如 Dreamer、TD-MPC2 等),避免了长时域下的发散问题,且能直接部署于真实机器人硬件。
实验
实验设计
实验在真实机器人操作任务上展开,覆盖策略评估、策略改进及测试时规划三类下游应用。评估指标包括:
- 模拟轨迹与真实成功率的 Pearson 相关系数 ρ 衡量保真度
- 在 π₀.₅ 基础模型上叠加 WEAVER 策略改进后的真实世界成功率增益
- 利用世界模型进行在线规划时的成功率与推理速度
对比基线为先前的主流操作世界模型(如基于扩散或自回归的 WM)。所有评估均在训练分布内及分布外 (OOD) 场景下进行,以考察泛化能力。
关键发现
- 帕累托占优:WEAVER 在保真度、长程一致性与推理效率三个维度上同时超越此前方法,形成帕累托前沿的实质推进。
- 高置信度策略评估:模拟轨迹与真实成功率的相关系数高达 0.870,表明世界模型可高度可靠地替代真实环境进行离线策略筛选。
- 无需真实交互的策略改进:基于 WEAVER 的“模拟重放”将基础模型成功率绝对提升 38%,且改进后的策略直接部署到真实机器人时几乎无性能衰减。
- 快速在线规划:推理速度较先前 WM 提升 5–10 倍,同时成功率比最优基线高 14% ,尤其在 OOD 场景下优势更为明显。
基线对比深度解读
相比典型延迟较高的扩散世界模型,WEAVER 通过多视角潜空间流匹配与键值缓存机制,在不牺牲生成质量的前提下大幅降低单步推理耗时——这是实现测试时规划加速的关键。在策略改进任务中,单纯使用基础模型自身生成的模拟数据进行自我训练容易导致分布偏移,而 WEAVER 生成的高保真回放数据有效缓解了这一问题,从而带来显著的性能增益。值得注意的是,在 OOD 测试中 WEAVER 的领先幅度更大,说明其潜空间结构化设计比单纯增加模型容量或数据规模更利于提升鲁棒性。
行业影响
落地场景
WEAVER 世界模型可直接嵌入机器人操作任务的产品研发管线,适用于仓储物流、柔性制造、服务机器人等需要灵巧操作的环境。其多视图轨迹生成能力可替代大量真实硬件试错:在物流分拣场景,利用世界模型评估抓取策略对新物品泛化性,大幅降低物理测试次数;在自动驾驶范式中,也能扩展为仿真器用于端到端控制策略的虚拟验证。
商业价值
- 降本:减少物理机器人运行时长与硬件损耗,节省数千小时的真实交互时间,将策略迭代周期从数周压缩到小时级。
- 增效:通过 测试时规划 在推理阶段动态优化动作序列,实测提升任务成功率14% 并带来5-10倍推理加速,直接转化为更高的产线吞吐与服务可靠性。
- 增收:更快的策略改进(38% 成功率跃升)使机器人操作方案能更快交付客户,抢占市场窗口;基于 策略评估 的高置信度离线验证(相关性 ρ=0.870)可支撑 "仿真即服务" 的订阅模式。
与现有工作流集成
WEAVER 可与主流机器人中间件(如 ROS 2)及基础模型(如 π₀.₅)松耦合集成:
- 作为 策略评估器 接入 CI/CD 管道,在代码合入前验证变更;
- 通过 策略改进 脚本,利用离线世界模型增强现有策略权值,无需额外真实交互;
- 部署为 测试时规划 模块,以毫秒级延迟生成多步骤动作,适合边缘端实时控制。 模型输入输出采用标准化动作/观测空间,训练代码与预训练权重已开源 GitHub,可快速适配自定义机械臂与传感器配置。
具体场景示例
- 电商仓储分拣:面对日新月异的商品外形,利用 WEAVER 在虚拟环境中对抓取策略进行数百万次快速评估,筛选出高成功率策略后再小批次上机验证,使新品入库后的自动抓取方案适应时间从 3 天缩短至数小时。
- 汽车装配线:在引入新型零部件时,通过世界模型生成的仿真轨迹,离线对装配策略进行逐步改进,并在上线前通过测试时规划实时修正动作,避免因策略失误导致的产线停摆与高价值工件损坏。
局限
- - **部分可观测性限制**:WEAVER 依赖多视图 RGB 观测进行未来预测,但真实机器人操作场景常涉及遮挡、传感器盲区或仅从第三视角无法完全推断的物理状态(如物体内部受力)。论文附录 A5.1 也明确承认部分可观测性对模型长期一致性构成挑战,可能导致累积误差,尤其是在长程操控中,某些关键隐变量(如摩擦力、物体质量)无法从图像中直接推断,引起轨迹偏离真实。
- - **复杂可变形与动态交互的泛化不足**:当前评估主要围绕刚性物体或简单可变形物(如布料折叠),对于流体、颗粒材料或高速动态碰撞任务,流匹配损失可能难以捕捉精细的物理约束,且多视图特征聚合在这种高维非规则变化下易丢失细粒度几何信息。附录 A5.2 指出模型在极端动态与复杂接触场景中保真度下降,说明架构和数据驱动方法对物理先验的依赖较弱,泛化到这类任务仍需额外机制。
- - **测试时规划范围受限**:WEAVER 虽提升了推理效率,但在测试时规划中仍采用滚动窗口预测并依赖价值估计进行引导,由于生成式世界模型自身的复合误差,当规划步数过长时价值估计偏差会加剧,导致策略退化。论文附录 A5.3 提到当前仅支持有限的长期规划,实际部署中用户需在规划范围与计算开销之间手动权衡,限制了该方法在需要超长序列决策(如住宅清洁机器人)中的直接应用。