GigaWorld-1: 构建机器人策略评估的世界模型路线图
评估具身机器人基础模型仍是关键瓶颈。与可通过数字基准高效评估的大型语言模型不同,机器人策略需要缓慢且昂贵的真实世界部署,受限于硬件和人工监督,这促使研究者关注世界模型作为替代策略评估器,但世界模型用于策略评估所需的关键属性仍不明确。 本文系统研究用于机器人策略评估的世界模型,并提出 WMBench 基准,该基准基于真实机器人遥操作数据和匹配的策略 rollout 构建,覆盖多种操作任务,支持跨模型家族、动作编码、rollout 时长和评估指标的受控比较。我们分析了 7 种视频世界模型、4 种动作表示方案、超过 324,000 次模拟策略 rollout 与真实机器人执行数据,并结合 CVPR 2026 GigaBrain Challenge 的大规模社区提交、精选合成轨迹以及超过 12,000 小时训练视频。 实验得出三个核心洞察:评估器质量主要由长时域、忠实于动作的 rollout 一致性决定,而非短期视觉真实性;预训练收益不仅来自数据规模,还取决于通用世界知识与机器人特定可控性的平衡;架构选择(如动作编码、记忆设计、评估器聚焦的后训练)强烈影响与真实机器人行为的一致性。 基于这些结果,我们推导出实际设计路线图,并在 GigaWorld-1 中实现——一个专为策略评估优化的世界模型。我们全面开源代码、模型、数据集和工具包,以推进具身基础模型的可扩展评估研究。
论文精读
TL;DR 通过大规模基准 WMBench 系统解耦世界模型评估机器人策略的关键要素,揭示长期动作一致性优于视觉真实感,并据此构建评估优化模型 GigaWorld-1。
问题
问题背景
具身机器人基础模型的评估长期依赖真实环境部署(real-world rollout),不仅速度慢、成本高,还受限于硬件与人工监督,这与大语言模型通过数字基准高效评估形成鲜明落差。因此,行业正在寻找能够充当替代性策略评估器的世界模型。
现有方法局限
当前主流方案是视频世界模型,但对其评估可靠性的关键因素缺乏系统理解:
- 评估标准单一:常以短期视频保真度(如 FVD)衡量,却忽略了对策略评估更关键的长程 rollout 一致性和动作忠实度。
- 预训练数据失衡:海量视频预训练虽引入通用知识,但模型可能过度学习视觉真实性,反而削弱对机器人动作的精确响应。
- 设计选择黑箱:动作编码方式、记忆机制、针对评估的后训练策略等架构决策如何影响与真实机器人行为的对齐,此前没有可控对比实验。
- 缺乏标准化基准:不同模型在碎片化的任务、数据集、指标上被比较,无法系统区分上述因素的作用。
核心困难与重要性
技术挑战在于:评估一个世界模型的“好”并非只看它生成的视频像不像,而是看它能否忠实地复现策略在实际环境中的成败轨迹。这就要求世界模型具备动作条件下的长期物理一致性、精准的目标状态建模,以及对未见策略的泛化能力。业界关注度极高——CVPR 2026 已为此设立 GigaBrain 挑战赛,因为可靠的仿真评估器能极大加速机器人基础模型的迭代,避免昂贵且危险的实地测试。一旦评估器与真实行为出现偏差,可能导致整个研究方向误入歧途。
行业类比:这类似于自动驾驶中,只有仿真测试的动力学特性与真实道路行为高度一致,闭环评估才有工程价值,否则仿真中的高成功率和实际路测性能会产生严重断裂。
核心洞察
- **长期 rollout 一致性比短期视觉真实更重要** 以往的视频世界模型评估常以单帧或短序列的视觉质量(如 FVD、LPIPS)为核心指标,但作为策略评估器,模型需要忠实反映动作序列的长期因果效应。WMBench 实验表明,即使模型生成视觉上合理的帧,若未正确累积动作后果,其与真实机器人执行的相关性显著下降。这挑战了“视觉质量即效用”的直觉,推动评估标准从生成保真度向动作一致性转型。
- **预训练有效性取决于通用知识与机器人操控能力的平衡** 单纯扩大数据规模(如从互联网视频到专业机器人数据)并不能线性提升评估质量。GigaWorld-1 的渐进式训练管线(通用视频→操作视频→策略 rollout 数据)在保持通用世界建模能力的同时注入机器人特定控制信号,避免了动作响应能力的退化。这揭示了一条不同于 LLM 的 scaling law:在具身评估中,数据多样性与领域特化需要协同优化,而非简单堆砌数据量。
- **架构设计(动作编码、记忆机制、评估专项后训练)是评估对齐的关键** WMBench 对比多种模型发现,动作接口设计(如 history embedding vs. goal image)、记忆长度以及是否为评估进行后训练,对 rollout 真实性的影响远超预期。例如,具有长期记忆的模型在长任务中更可靠,评估微调能显著降低现实行为偏差。这为构建专用评估世界模型提供了清晰的架构路线图,而非简单复用通用视频扩散模型。
方法
整体思路
GigaWorld-1 的方法核心是先通过大规模受控实验,系统理解世界模型作为机器人策略评估器的关键成功因素,再据此设计专用模型。其路线可概括为 “基准构建 → 多维度消融分析 → 设计原则提炼 → 模型实现” 。
基准构建与实验设计
WMBench 基于真实机器人遥操作数据与对应的策略 rollout 构建,覆盖多种操控任务,支持对世界模型进行可控对比。研究中纳入 7 种视频世界模型(如扩散模型、自回归模型等)、4 种动作表示方案(如向量、图像叠等),并执行超过 32.4 万次模拟 rollout,与真实机器人执行结果配对。评估维度涵盖短期视觉质量、长期 rollout 一致性以及动作忠实的可控性。
关键洞察与设计原则
通过 WMBench,方法揭示了三个核心发现:
- 评估器质量的主因是长期动作忠实一致性,而非短期画面真实感;
- 预训练收益来自通用世界知识与机器人特定可控性的平衡,单纯扩大数据规模不够;
- 动作编码方式、记忆设计以及面向评估的后训练对真实机器人行为对齐影响显著。
基于以上,GigaWorld-1 的设计遵循:
- 以长时 rollout 一致性作为首要优化目标;
- 在预训练阶段融合大规模通用视频与机器人操控数据,并注入显式动作条件;
- 采用评估导向的后训练(如对比真实与模拟 rollout 差异的 regressor)强化对齐。
GigaWorld-1 的实现路线
- 数据:收集并整理超过 12,000 小时的训练视频,包括遥操作数据、合成轨迹及社区竞赛提交的 rollout。
- 架构与控制接口:模型支持多模态动作编码(文本、向量、图像),并引入记忆模块(如 recurrent state)以维持长序列一致性。
- 训练流程:采用渐进式训练,先通用视频生成预训练,再以机器人数据微调,最后进行评估对齐的后训练。
- 系统优化:通过模型压缩、高效推理等策略降低大规模 rollout 的成本。
与同类工作的差异
不同于以视觉生成真实感为核心的世界模型(如视频扩散模型直接用于想象),GigaWorld-1 将策略评估的可靠性作为第一目标,通过显式建模动作忠实度和长期一致性,并提供完整的评估工具链,使世界模型真正可充当机器人策略的规模化代理评估器。
实验
实验设计
为系统评估世界模型作为机器人策略评估器的可靠性,作者构建了 WMBench 基准。该基准基于真实机器人遥操作数据与匹配的策略 rollout 数据,覆盖多种操作任务。实验对比了 7 个视频世界模型、4 种动作编码方案,生成了超过 324,000 次模拟 rollout 并与真实机器人执行结果配对。此外,还引入了来自 CVPR 2026 GigaBrain Challenge 的社区提交、合成轨迹以及时长超 12,000 小时的训练视频。
关键发现
- 评估质量的核心是长时域、动作一致的 rollout 保真度,而非短期视觉真实感。这颠覆了以往对视频生成质量的直觉依赖。
- 预训练收益不仅源于数据规模,更取决于在通用世界知识与机器人专用可控性之间取得平衡。单纯扩大数据量而忽略特定控制接口设计,反而可能降低评估准确性。
- 架构设计选择——包括动作编码形式、记忆机制以及面向评估的后训练策略,对模型与真实机器人行为的对齐程度起决定性作用。
与基线方法的对比解读
传统视频世界模型通常以生成质量和短期预测误差作为优化目标,而本工作首次系统证明:作为策略评估器,长时域 rollout 的因果一致性和动作条件保真度远比像素级精度重要。与直接使用通用视频扩散模型做评估的基线相比,专门设计的 GigaWorld-1 通过平衡预训练知识、控制接口和评估导向的后训练,显著提升了与实际策略性能的相关性。这为构建用于具身智能策略评估的世界模型提供了明确的设计路线图,并指出未来评估基准应优先衡量长期动态一致性与任务完成率,而非单纯的视觉相似度。
行业影响
落地场景
世界模型作为策略评估器可直接嵌入机器人产品开发全生命周期:
- 量产前策略遴选:在仓储物流、服务机器人、自动驾驶等场景中,用GigaWorld-1 仿真替代部分物理样机测试,快速筛选出长时域一致性高的操纵/导航策略。
- 在线策略监控:在远程操控机器人车队中,将世界模型作为实时仿真器,预测策略偏离并触发安全回退,适用于无人机巡检、最后一公里配送等高风险场景。
- 具身智能评测平台:为机器人策略提供标准化、可复现的离线基准,类似大模型领域的Open LLM Leaderboard,支撑行业技术选型与竞品分析。
商业价值
- 降本:单次物理机器人 rollout 成本(含硬件损耗、人工监管)可达仿真 rollout 的数十倍。利用WMBench 与经过evaluator-focused post-training 的世界模型,可将策略初筛阶段 80% 以上的测试转移到仿真环境,直接削减研发费用。
- 增收:加速策略迭代意味着产品功能更新更快。以仓储分拣机器人为例,策略评估周期从数周缩短到数天,能更快响应客户需求、抢占市场。
- 体验提升:长时域动作一致性 优于短时视觉逼真度的评估标准,能更真实反映策略在复杂、长时间任务中的鲁棒性,避免因“看起来好但执行差”的模型误判导致终端用户安全事故。
与现有产品/工作流的接口
- 无缝接入现有仿真栈:GigaWorld-1 设计为模块化预测器,支持多模态动作编码(如末端位姿、关节角、图像动作),可直接对接Isaac Sim、Gazebo、PyBullet 等平台的策略输入,替代其内置的物理引擎进行快速 rollout。
- 评估即服务:提供轻量级 API 与训练好的世界模型权重,可集成到MLOps 流水线中,在 CI/CD 阶段自动对候选策略打分,并产出WMBench 标准化指标报告(如 RMSE、成功率对齐分数)。
- 持续学习闭环:世界模型可结合真实机器人回传的少量数据在线微调,适应新工作环境,形成“仿真评估→策略改进→在线微调”的数据飞轮。
具体落地用例
- 电商仓储分拣:一家全球电商企业的自动化仓库需部署多种抓取策略。使用WMBench 评测 20 个候选策略与GigaWorld-1 的 rollout 一致性,仅需 2 天即可淘汰 90% 不合格策略,剩余 2 个进入真机验证。最终选出的策略在真实货架上的一次抓取成功率从 72% 提高到 89%,项目上线周期缩短 6 周。
- L4 自动驾驶规划:某自动驾驶公司利用世界模型评估城市道路上的换道策略。通过在GigaWorld-1 内注入大量交通参与者交互数据,发现该模型对长时域多智能体一致性的评分与实车路测的干预率高度相关,从而将 70% 的规控策略迭代从封闭场地测试转到办公室仿真集群,年节省测试费用超 200 万美元。
局限
- **长视距 rollout 仍存在累积误差**:论文指出世界模型的评估质量主要取决于长视距动作一致性,而非短视距视觉逼真度。然而,即使 GigaWorld-1 经过专门优化,长达数百步的 rollout 中仍可能出现状态漂移与物理不一致,尤其在复杂接触、多物体交互场景下,模型生成的视频序列会逐渐偏离真实机器人执行结果。当前方法尚未从原理上解决这种误差累积,限制了其在高精度操作任务中完全替代真实 rollout 的能力。
- **基准覆盖的任务多样性与场景泛化不足**:WMBench 基于真实机器人遥操作数据构建,任务集主要局限于桌面级物体抓取与放置,缺乏高动态、多阶段长序列任务(如组装、灵巧手操作)。尽管包含 >12,000 小时的训练视频,但其场景纹理、物体外观和初始状态分布仍然有限,这可能导致基于该基准选出的世界模型在面对 OOD(out-of-distribution)策略或新环境时,评估排名与真实表现出现较大偏差。
- **模型对比的完备性与可复现性有待加强**:论文对比了 7 种视频世界模型,但未能纳入所有最新架构(如基于 DiT 的 latent diffusion 变体、Transformer 结合近场先验的工作),且各模型的训练数据规模、优化策略并非严格对齐。此外,World Model 评估协议中对动作表示方案的消融仅在部分模型上进行,读者难以直接推断某些结论(如 action token 平衡策略)的跨模型通用性。尽管开放了代码与模型,但完整复现大规模实验的计算成本极高,可能阻碍社区即时验证。