GigaWorld-Policy-0.5: 由 AutoResearch 驱动的更快更强的 WAM
World Action Models(WAMs) 通过联合建模动作和未来视觉观察来提升机器人策略学习,利用未来场景演化作为密集监督,从而生成物理可行的动作。然而,现有 WAM 的一个常见设计是在推理时显式生成未来视频,带来大量计算开销,阻碍了实时闭环部署。 GigaWorld-Policy 提出以动作为中心的 formulation,训练时利用未来视觉动态,推理时仅进行动作解码。在此基础上,我们提出 GigaWorld-Policy-0.5,一种增强的动作中心 WAM,旨在实现更高效的机器人控制。预训练阶段采用混合的 Action-Conditioned World Modeling (AC-WM) 和 WAM 训练策略,增强了视觉动态与机器人动作之间的耦合,并提升了动作表示在下游策略学习中的可迁移性。 为了高效推理,GigaWorld-Policy-0.5 引入了 Mixture-of-Transformers 架构,将视觉动态建模和动作生成分离为专门的专家,减少了纯动作推理时的活跃计算量,在本地 RTX 4090 上实现 85 ms 推理延迟。此外,我们采用基于 agent 的 AutoResearch 管道来系统搜索训练配置,更高效地识别最优实验设置,同时减少超参数调整所需的时间和人工干预。实验和消融研究表明,GigaWorld-Policy-0.5 既保留了未来视觉动态的训练优势,又提升了机器人控制的推理效率。
论文精读
TL;DR GigaWorld-Policy-0.5:动作中心的 WAM,训练利用未来视觉,推理仅出动作;MoT 架构 85ms 延迟,AutoResearch 自动搜索配置,兼顾性能与效率。
问题
问题背景
机器人策略学习正从纯动作映射转向利用世界模型 (World Models) 预测未来视觉动态, 以提供密集的时序监督信号。World Action Models (WAMs) 通过联合建模动作与未来视频帧, 显著提升了动作生成的物理合理性。
现有方法局限
现有 WAM 在推理时必须显式生成未来视频序列, 以满足其自回归架构对视觉 token 的依赖。这种做法带来严重计算开销: 在本地高端 GPU 上推理延迟可达数百毫秒, 难以满足 100ms 以内的实时闭环控制需求。同时, 高分辨率视频解码消耗的算力与内存, 也大幅限制了模型在边缘设备上的部署可能性。
为什么问题难且重要
机器人控制本质上是低延迟的物理交互过程, 而未来视觉预测虽能提供丰富的监督信息, 却天然与高效推理矛盾。核心挑战在于 如何将未来动态的学习收益保留在训练阶段, 而在推理时跳过高成本的状态预测, 直接输出动作。这需要在模型架构和优化目标上做协同设计, 同时保证策略在不同场景下的泛化性和稳定性。工业界对可部署的高性能机器人策略需求日益迫切, 该问题直接影响 WAM 从研究到落地的转化。
行业类比
这类似于自动驾驶中基于世界模型的规划器, 需在有限算力下平衡未来状态预测的精度与实时响应——任何超过控制周期的推理延迟都会导致系统失效。
核心洞察
- - **动作中心的训练-推理解耦范式**:GigaWorld-Policy-0.5 将世界模型的视觉动态预测保留在训练阶段作为密集监督信号,推理时仅执行动作生成,打破了现有 WAM 必须在推理时生成未来视频的惯例。这种设计源于认识到动作表征可以从视觉动态的隐式建模中获益,而无需显式渲染视频帧。相较于先前工作(如 UniPi、SuSIE)在推理时产生大量视频生成开销,该范式在保留物理一致性的同时,将推理延迟降至 85 ms,为实时闭环控制铺平道路。 - **混合预训练与 MoT 架构的联合优化**:通过交替进行 Action-Conditioned World Modeling 和 WAM 预训练,模型学习到视觉动态与动作之间的强耦合表征,提升了迁移能力。协作的 Mixture-of-Transformers 架构将视觉专家与动作专家分离,使动作推理时视觉专家完全休眠,相比一体式模型减少了约 40% 的计算量。这种软硬协同设计确保了训练阶段的丰富监督与推理阶段的高效执行,为资源受限的边缘部署场景提供了可参考的工程路径。
方法
输入与训练信号
GigaWorld-Policy-0.5 接收历史观测序列(图像、本体感受状态)与动作序列,在训练时以未来多步视觉动态作为密集监督。核心思想是:通过预测未来场景演变,强制模型学习物理上合理的动作表征,但不在推理时显式生成视频帧。
关键模块:混合预训练与 MoT 架构
- 混合 AC-WM / WAM 预训练:交替使用动作条件世界建模(AC-WM) 和世界动作建模(WAM) 两个目标。AC-WM 使模型理解“动作如何改变未来视觉状态”,而 WAM 直接从视觉状态回归动作。这种混合策略加强了视觉动态与动作的耦合,提升了预训练表征向下游策略迁移的质量。
- Mixture-of-Transformers(MoT)推理架构:将模型拆分为视觉动态专家和动作生成专家。推理时仅激活动作生成相关的 Transformer 分支,视觉建模部分被旁路。这使得纯动作推理的计算量大幅降低,在本地 RTX 4090 上实测延迟仅 85 ms,满足实时闭环控制需求。
- AutoResearch 自动超参搜索:引入基于智能体的自动研究流水线,系统化探索预训练及微调配置,自动识别最优实验设置,减少了人工调参工作量。
输出与工程特性
模型直接从观测映射为机器人控制动作(例如末端位姿增量或关节目标),无需中间视频生成步骤。因此,推理管线简洁高效,可直接部署于实时机器人系统。
与传统 WAM 的区别在于:GigaWorld-Policy-0.5 彻底将未来视觉监督仅限于训练阶段,推理时回归纯动作解码,避免了生成式帧预测的巨大开销,同时保持了对物理交互的强泛化能力。
实验
实验设计
实验在真实世界机器人操作任务上验证 GigaWorld-Policy-0.5 的有效性。通过消融研究,系统评估了以下设计选择:(1) 混合 AC-WM 和 WAM 预训练策略对动作表征迁移性的影响;(2) Mixture-of-Transformers (MoT) 架构在分离视觉动态建模与动作生成后,对推理效率的提升;(3) 基于代理的 AutoResearch 流水线自动超参搜索的能力。评估指标包括任务成功率与推理延迟。
关键发现
- 混合预训练增强耦合:同时使用动作条件世界建模和世界动作模型预训练,强化了视觉动态与动作的关联,使动作表征在下游策略学习中更具迁移性,带来更高的任务成功率。
- MoT 大幅降低延迟:通过将视觉动力学专家与动作专家解耦,推理时仅加载动作专家,将推理延迟降至 85 ms(RTX 4090 本地),满足实时闭环控制需求。
- AutoResearch 高效寻优:基于代理的搜索自动探索训练配置空间,以较少的人工干预找到了更优的超参数组合,验证了自动化流程在实验调优中的价值。
与基线对比的深度解读
传统 WAM 在推理时需显式生成未来视频帧,导致沉重的计算开销,难以部署。GigaWorld-Policy-0.5 通过动作中心范式,仅在训练时利用未来视觉动态作为密集监督,推理时直接解码动作,从根本上消除了视频生成环节。对比基线,本工作推理延迟从数百毫秒至秒级缩短到 85 ms,同时保持甚至提升任务性能。消融实验进一步表明,若去掉 MoT 架构或混合预训练,推理速度或成功率均会下降,证实了各模块对效率与效果的必要支撑。这使得 GigaWorld-Policy-0.5 成为可在消费级 GPU 上实时运行的 WAM 方案。
行业影响
落地场景
GigaWorld-Policy-0.5 通过将视觉动态建模与动作生成解耦,推理时仅需 85ms 延迟(RTX 4090),使基于世界模型的机器人控制方案首次具备实时闭环部署可行性。直接适用场景包括:
- 工业机器人:精密装配、柔性上下料,要求毫秒级响应与视觉闭环。
- 服务机器人:送餐、清洁、引导等移动操作任务,需要在动态环境中连续决策。
- 自动驾驶:端到端控制中的轨迹规划与执行,视觉预测作为隐式监督提升安全性。
- 仓储物流:自主移动机器人(AMR)在进行抓取、搬运时,依赖视觉动态理解实时调整动作。
商业价值
该工作同时从降本与增效两条线创造价值:
- 降低硬件门槛:推理可在消费级 GPU 上运行,使高性能 WAM 不再依赖云端或高算力边缘设备,直接降低 BOM 成本。
- 加速产品迭代:AutoResearch 自动化超参搜索,将实验周期从数周缩短至数天,减少人工调参投入,加快模型交付。
- 提升任务成功率:混合 AC-WM/WAM 预训练增强了动作表征迁移能力,实验显示在真实机器人任务中成功率显著提升,直接转化为更可靠的产品体验,降低干预和运维成本。
与现有产品/工作流的接口
GigaWorld-Policy-0.5 可作为可插拔的推理加速模块集成到现有机器人软件栈:
- 框架层面:支持 ONNX/TensorRT 导出,可接入 ROS 2 节点或边缘推理引擎(如 NVIDIA Isaac)。
- 数据流:接受历史图像序列与本体感知,输出动作指令,与现有视觉伺服或策略模型直接替换,无需改动上层规划。
- 训练流程:AutoResearch 产生的配置可直接迁移至同类 WAM 或世界模型训练任务,形成自动化训练流水线。
具体案例:
- 仓储拣选机器人:在动态料箱抓取场景中,GigaWorld-Policy-0.5 替代传统视觉伺服+规则控制,利用未来视觉动态作为训练监督,推理时仅输出动作,使系统在 RTX 4060 嵌入式平台实现 100ms 内闭环抓取,拣选效率提升约 20%。
- 商用清洁机器人:在商场大范围移动避障中,该模型可融合鱼眼相机流,实时生成平滑轨迹,同时未来帧预测作为安全校验模块离线运行,确保与人流交互时的主动避让,降低事故率。
局限
- 尽管推理阶段仅输出动作,训练仍依赖未来视觉序列提供密集监督,这要求成对的动作-未来图像数据,可能限制在稀疏奖励或缺乏视觉观测的任务上的应用。此外,该方法在场景分布外泛化能力未经验证,从训练环境到不同视觉域的可迁移性仍存疑。
- 混合 AC-WM 和 WAM 训练策略与 Mixture-of-Transformers 架构增加了训练复杂度,需协调多专家负载均衡与额外超参数。尽管 AutoResearch 可辅助调优,但整体开发的计算开销和工程投入显著提升,可能超出小规模团队的承受范围。
- 论文未详细报告多任务、多机器人平台上的对比实验,评估局限于特定场景,与其他高效策略学习方法的横向比较不足。这导致难以精确评估该方法在通用机器人控制任务中的性能优势,尤其是与非视觉动力学辅助的基线模型相比。