论文

Uranus: 构建面向 Embodied AI 的下一代仿真基础设施

Uranus: 构建面向 Embodied AI 的下一代仿真基础设施

可扩展仿真 对机器人数据生成、策略训练、评估与安全迭代至关重要,但真实世界交互成本高昂,而传统仿真器需要大量人工构建。 我们提出 Uranus,一个围绕 joint-trajectory-conditioned 自回归扩散模型 构建的数据驱动机器人仿真器。Uranus 提供三项关键能力: 1. 流式开放式 rollout:在线接收未来关节位置轨迹,每步自回归生成一个 latent frame,对应四帧 RGB,无固定时间跨度; 2. 低延迟生成:经推理优化后达到 24 FPS; 3. 可扩展、可拓展的机器人控制:为多种机器人形态与相机配置提供同步多视角生成的统一接口。 我们在 in-distribution 与 out-of-distribution 数据上开展了全面的定量与定性评估,客观评估 Uranus 并明确指出其当前局限。我们开源代码与模型权重,为社区提供实用工具与洞见。

论文精读

TL;DR Uranus 是一个基于关节轨迹条件自回归扩散模型的数据驱动机器人模拟器,支持开放域流式生成、24 FPS 低延迟与多视角跨本体控制,为 Embodied AI 提供可扩展仿真基础设施。

问题

问题背景

Embodied AI 的训练与评估高度依赖可扩展仿真,以生成大规模机器人数据、训练策略,并在安全环境中迭代。当前领域正从传统物理引擎转向数据驱动的神经仿真。

现有方法局限

传统仿真器(如 Isaac Sim、Gazebo)需要人工建模场景、传感器与物理参数,难以覆盖开放世界的多样性,构建成本高且泛化弱。现有 robot world model 通常为固定 horizon 的离线生成,无法在线接收未来关节轨迹并持续输出;推理延迟高,难以支撑实时闭环策略交互;跨不同机器人 embodiment 与相机配置的适配需重新训练或定制接口,缺乏统一可扩展的控制机制。此外,diffusion 模型的多步去噪导致生成速度远低于实时需求。

为什么这个问题难/重要

同时实现 streaming open-ended rollout、低延迟(24 FPS)和跨 embodiment 可扩展性存在三重技术冲突:自回归生成需保持因果性与长时一致性,但扩散模型推理计算量大;多视角、多本体条件注入要求模型在不损失生成质量的前提下灵活适配;流式低延迟要求对 KV cache、VAE 解码和调度进行深度系统优化。该问题在业界关注度极高,因为数据驱动的神经仿真有望替代昂贵且缓慢的真实机器人数据采集,大幅加速 policy 迭代与 sim-to-real 研究。

行业类比

这一方向类似于 NeRF 与 3D Gaussian Splatting 将图形渲染从手工建模转向神经渲染,Uranus 试图将机器人仿真从手工场景搭建转向由数据驱动的生成式模拟。

核心洞察

  • Uranus 将数据驱动的视觉动力学模型直接用作机器人模拟器,替代传统基于物理引擎的仿真。与需要手工建模场景、物体和物理参数的 Isaac Sim 等工具不同,Uranus 仅依赖关节轨迹条件,通过扩散模型生成逼真的 RGB 视频,无需显式几何或物理先验。这一思路将模拟器的构建成本从人工建模转向数据收集,使得覆盖复杂真实环境成为可能,大幅降低为特定任务定制模拟器的门槛。
  • Uranus 实现了流式、开放式的 rollout 生成,支持在线接收未来关节位置轨迹并逐帧输出,没有固定 horizon,同时经过推理优化达到 24 FPS。现有视频扩散模型通常生成固定长度的片段,难以直接用于需要实时反馈的闭环策略评估;而 Uranus 通过自回归架构与滑动窗口 KV cache、流式 VAE 解码等工程优化,首次将扩散模型的视觉质量与实时交互需求结合,使数据驱动模拟器可以嵌入机器人控制回路。
  • Uranus 通过统一的条件化接口支持跨 embodiment 和多视角同步生成,将机器人构型与相机配置作为可控输入。大多数机器人世界模型针对单一 embodiment 训练,难以迁移到不同机器人;Uranus 将关节轨迹、embodiment 标识和视角参数共同条件化,一个模型即可服务多种机器人和传感器布局。这种设计显著提升了基础设施的可扩展性和复用性,为构建通用机器人模拟平台提供了新的工程范式。

方法

Uranus 的方法核心是一个 joint-trajectory-conditioned autoregressive diffusion model,以未来关节位置轨迹在线输入为条件,逐步生成对应四帧 RGB 的 latent frame。

输入与条件

  • 输入:流式 future joint-position trajectories,以及 embodiment 标识和 camera 配置,统一编码为 condition embeddings。
  • 历史 latent tokens 与条件一起作为自回归上下文。

关键模块

  • Spatial-Temporal Diffusion Transformer 作为主干网络,在空间和时间两个维度执行注意力,同时处理多视角 latent patch tokens。
  • Autoregressive Diffusion Model 每步接收历史 latent 和当前条件,去噪生成下一个 latent frame,并通过 Causal Long-Horizon Generation 机制保持一致性。训练中采用 Teacher-Forcing Causal Mask、Latent-Frame-Relative RoPE 和 Reference Attention Sink 等策略强化时间因果性。
  • Cross-Embodiment and Multi-View Conditioning 通过统一接口注入 embodiment 和 camera 参数,支持不同机器人和多视角同步生成。
  • Diffusion Step Distillation 减少扩散步数,配合推理阶段的 Sliding-Window KV Cache 与 Streaming VAE Decoding,达到 24 FPS 低延迟。

输出

模型每步输出一个 latent frame,经 VAE decoder 解码为四张 RGB 图像,形成无限时长的流式视频 rollout。

与固定 horizon 的 world model 相比,Uranus 的关键差异在于真正支持 open-ended streaming generation,并将低延迟推理和多 embodiment 可扩展性融入统一架构。

实验

实验设计

Uranus 的评估围绕 长视界交互、OOD 泛化 与 仿真一致性 展开。核心基准是 WorldOlympiad,用于测试流式开放结束 rollout 在长序列下的稳定性;同时对比当代机器人世界模型,分析场景、轨迹、任务、具身四个维度的泛化能力;最后通过开环一致性指标与闭环策略交互,衡量生成视频与实际物理响应的吻合度。整体设计兼顾定量与定性,目标是为数据驱动模拟器提供可复现的评测框架。

关键发现

实验表明,Uranus 具备三个关键能力:流式开放结束 rollout——接收未来关节轨迹并逐帧自回归生成,每步输出 4 帧 RGB,无固定 horizon;低延迟生成——经推理优化后达到 24 FPS;跨具身多视角控制——统一接口支持同步多视角生成。与固定 horizon 的扩散世界模型相比,Uranus 在长时程一致性上更具优势,但作者也明确指出在 OOD 场景下仍存在性能下降,当前模型对分布内数据依赖较强。

基线对比解读

与需要人工搭建的经典模拟器相比,Uranus 的数据驱动方式大幅降低了场景构建成本,尤其适合多样化的机器人形态与相机配置。相较于现有机器人世界模型,Uranus 的流式架构消除了 fixed-horizon 限制,在 online policy 交互中更加灵活;但 24 FPS 虽满足实时交互,仍低于部分专用推理系统,且在复杂物理接触或未见过物体上的保真度有限。工程上,这个权衡表明:若追求低延迟,需在扩散步数蒸馏与 KV 缓存压缩上进一步优化;若追求高保真,则应结合少量真实数据微调。

行业影响

落地场景

Uranus 作为数据驱动的机器人仿真器,可直接嵌入 具身智能 开发流水线,覆盖三类场景:

  • 机器人数据工厂:为仓储分拣、家庭服务机器人批量生成训练视频与状态序列,替代部分真实遥操作采集
  • 策略闭环评估:在云端或边缘侧以 24 FPS 流式生成多视角 RGB,支持 policy 在线安全测试与故障复现
  • 跨本体迁移验证:利用统一接口在多机械臂、人形机器人配置间快速切换,加速新硬件适配

具体 use case:

  1. 电商仓储机器人:物流中心部署前,用 Uranus 模拟不同抓取轨迹的视觉后果,筛掉危险动作,减少真机碰撞损耗
  2. 自动驾驶数据增强:对罕见 corner case(如突然闯入的行人)做条件生成,扩充训练集,降低路测里程需求

商业价值

  • 降本主线:真实机器人数据采集成本高(硬件、人工、场景搭建),Uranus 以扩散模型按需生成,可显著降低数据获取边际成本
  • 增收辅助:快速原型验证缩短产品上市周期,使机器人方案提供商能在更短窗口内交付定制化 skill
  • 体验提升:为远程操作、机器人即服务 (RaaS) 提供低延迟仿真预览,增强客户信任与交互流畅度

与现有产品/工作流的接口

Uranus 提供模型权重与代码,可作为 仿真后端 接入现有 stack:

  • 与 ROS / Gazebo / Isaac Sim 等传统仿真器形成互补:传统仿真负责物理精确碰撞,Uranus 负责视觉与动力学外观的流式生成
  • 通过 REST / gRPC 暴露仿真服务,为云端训练平台(如 Kubernetes 上的批量 RL 任务)提供 on-demand 数据流
  • 结合 KV-Cache 持久化 与 流式 VAE 解码,易于在边缘设备部署,与实时控制系统(如 OPC UA / EtherCAT)联动

关键集成点在于「轨迹条件输入」:下游 policy 只需输出关节位置序列,无需理解生成细节,改造成本低。

局限

  • Uranus 作为数据驱动机器人模拟器,其生成一致性受限于训练数据分布。论文虽然报告了 OOD 场景、轨迹、任务、embodiment 的定性分析,但并未完全解决物理交互真实性问题。对于高接触、高动态或存在复杂材质变形的场景,模型可能生成不符合物理规律的视频帧,导致仿真偏差。与基于物理引擎的仿真器(如 Isaac Sim)相比,它无法保证硬性物理约束,在需要精确碰撞或力学响应的策略评估中存在风险。此外,跨 embodiment 的泛化仍以训练中见过的构型为基础,全新形态机器人的零样本迁移能力未得到验证。
  • 条件信号仅包含未来关节位置轨迹,这一设计虽然实现了低延迟 streaming 控制,但忽略了现实机器人任务中常见的其他控制模态(如末端力、视觉目标、语言指令等)。这使得 Uranus 难以直接用于视觉伺服、力控装配或语言引导操作等场景,限制了其作为通用模拟基础设施的覆盖面。同时,输出仅为 RGB 帧,缺少深度、触觉或本体感觉等辅助信息,对于依赖多模态传感器输入的策略学习方法不友好。相比 Genie 等以视频或语言为条件的 world model,Uranus 的交互维度较为单一。
  • 24 FPS 的推理速度是在专门优化后实现的,实际部署可能依赖高性能 GPU 与复杂 serving 架构(如 disaggregated DiT 和 VAE 解码),成本较高,难以在边缘设备或实时性要求更高的场景中采用。此外,自回归生成长序列时存在误差累积问题,即使采用 sliding-window KV cache 和 streaming VAE 解码,长时程 rollout(如 WorldOlympiad benchmark)中的物理一致性和帧间稳定性仍可能逐渐恶化,需要闭环策略校正或额外的状态估计模块,而这在论文中尚未深入讨论。
论文Wenkang Qin2026-09-23原文

相关内容