Xiaomi-Robotics-U0:基于世界基础模型的统一具身合成
现有的图像与视频基础生成模型虽然具备强大的泛化能力和可控性,但在具身场景中直接应用时受到多视角一致性、几何连贯性和机器人本体约束的限制。现有方法通常用小规模机器人数据微调基础模型,导致大规模预训练获取的视觉知识大量丢失。 本文提出 Xiaomi-Robotics-U0,一个 380 亿参数的多模态自回归模型,实现统一具身合成。它将具身生成视作基础图像与视频生成的扩展,联合优化文生图、图像编辑、具身场景生成、具身迁移和具身视频生成。该统一框架在保留预训练世界基础模型泛化能力的同时,使其适配具身场景。 Xiaomi-Robotics-U0 是首个支持跨多种机器人本体高质量多视角场景生成的模型,并引入结构化、可控的具身迁移,实现细粒度编辑的同时保持多视角一致性和交互动态。在单步与序列生成任务上达到 SOTA,人类评估中具身场景生成与迁移超越 GPT-Image-2.0,具身视频生成在 World Arena 排名第一,将 pi0.5 在困难真实世界操控任务上的分布外成功率从 36.9% 提升至 63.2%。 结果表明,基础世界模型既可充当具身世界模型,也可作为具身智能的可扩展数据引擎。代码与检查点见 https://robotics.xiaomi.com/xiaomi-robotics-u0.html。
论文精读
TL;DR Xiaomi-Robotics-U0 是 38B 参数的多模态自回归模型,将具身生成统一为预训练世界模型的自然扩展,首次实现跨机器人多视角场景生成与结构化可控迁移,并作为数据引擎将 π₀.₅ 策略的 OOD 成功率从 36.9% 提升至 63.2%。
问题
问题背景
近年来,基础图像与视频生成模型(如扩散模型、自回归视觉模型)在泛化能力和可控生成上取得了显著进展。然而,将这些模型直接用于具身场景(机器人操作、多视图场景合成)时,面临多视图一致性、几何连贯性和机器人具身约束三大核心挑战。
现有方法的局限
主流方案通常是在有限且异构的机器人数据上微调预训练基础模型,这导致:
- 灾难性遗忘:微调过程牺牲了大规模预训练获得的丰富视觉先验,模型在非机器人场景的生成质量急剧下降。
- 任务碎片化:面向单一任务(如视图合成或视频预测)设计的流水线,难以在不同具身形态(单臂、双臂、移动操作)间复用知识。
- 编辑不可控:对场景中的对象位姿、相机视角或机器人的精细编辑往往缺乏结构化控制,破坏交互动态和多视图的一致性。
技术挑战与业界关注
统一具身合成的难点在于需同时满足:
- 多任务联合:文本到图像、场景生成、具身转移、视频生成等任务共享同一参数空间;
- 保持预训练知识:不能像传统领域适应那样过度损害基础模型的通用视觉能力;
- 跨具身泛化:模型需理解不同机器人形态的运动学与视觉差异。
这一问题的重要性正被全球AI社区广泛关注:具身智能所需的高质量交互数据采集成本极高,可扩展的合成数据引擎是突破数据瓶颈的关键。同时,一个能够保留世界知识、又能精确操控具身属性的模型,是将世界基础模型真正应用于现实操作任务的前提。
行业类比
可类比为在保持通用代码生成能力的前提下,扩展LLM以支持特定硬件约束下的嵌入式编程——既要利用预训练的世界知识,又能输出高度结构化的、满足物理约束的结果。
核心洞察
- 统一具身合成框架将具身生成任务视为基础图像/视频生成的自然扩展,而非简单的领域适配。这与现有工作仅使用少量机器人数据微调基础模型的做法截然不同,Xiaomi-Robotics-U0 通过 380 亿参数的多模态自回归模型联合优化文本-图像生成、图像编辑、多视角场景生成、具身迁移和视频生成,保留了大规模预训练世界模型的泛化能力,使其在具身场景下依然能够输出几何一致、视角连贯的高质量结果。
- 结构化可控的具身迁移首次实现了对机器人操作场景的细粒度推理编辑,同时保持多视角一致性与交互动态。相较于同类工作牺牲一致性换取编辑能力,或只能进行全局风格迁移,Xiaomi-Robotics-U0 通过对场景结构、物体属性、机器人位姿等要素的组合控制,在不破坏原图多视图对齐和时序动态的前提下,完成局部语义修改,为仿真数据增强和高阶任务规划提供了全新的可控生成范式。
方法
问题建模与输入
Xiaomi-Robotics-U0 将具身合成统一为多模态自回归生成任务。输入可以是文本提示、场景描述、参考图像、掩码或操控指令,模型将这些异构信号编码为离散 token 序列,预测后续视觉 token,实现从文生图、图像编辑到多视角场景生成、具身迁移和视频生成的统一。
核心架构
模型基于 38B 参数的自回归 Transformer,遵循 “next-token prediction” 范式。视觉输入通过预训练的 VQ 编码器映射为离散 token,与文本 token 拼接,由 Transformer 自回归解码。关键设计在于:
- 联合训练多任务:将所有具身生成任务视为基础图像/视频生成的扩展,共享同一组模型权重,在单个训练中优化文生图、编辑、场景生成、具身迁移和视频生成。
- 可操控的具身迁移:引入结构化条件(如图像掩码、机器人姿态参数),在生成过程中保持多视角一致性和交互动力学,支持细粒度编辑。
- 高效训练与推理:训练分为单步生成和顺序生成两个阶段,逐步提升长序列质量。推理时结合 FlashAR 解码加速与 vLLM 集成,显著降低延迟。
输出
模型直接生成高保真、多视角一致的图像或视频,满足不同具身任务需求。例如,具身场景生成输出包含指定机器人类型的多视角场景图像,具身迁移则在保持场景结构和交互逻辑的前提下替换机器人或物体。
与同类工作的差异:现有方法通常用少量机器人数据微调基础模型,导致预训练阶段学到的丰富视觉知识被遗忘或退化。U0 通过将具身生成定位为对基础生成能力的“扩展”而非“覆盖”,在统一框架下联合优化多种任务,完整保留世界基础模型(world foundation model)的泛化能力,同时获得高质量的具身一致性。
实验
实验设计
Xiaomi-Robotics-U0 在五个统一任务上评估:文本到图像生成、图像编辑、具身场景生成、具身迁移、具身视频生成。具身场景生成与迁移采用人工 pairwise 对比,基线为 GPT-Image-2.0。具身视频生成在 World Arena 平台排名。真实世界操作实验以 π0.5 策略为基础,利用模型生成的合成数据扩充训练集,测试分布外(OOD)场景成功率。单步与序列生成任务均达到 SOTA。
关键发现
- 统一训练框架让 38B 参数自回归模型保留了大规模预训练的世界知识,同时适应具身多视角与几何一致性要求。
- 人工评估中,Xiaomi-Robotics-U0 在具身场景生成和迁移上显著优于 GPT-Image-2.0。
- 在 World Arena 具身视频生成榜单排名第一,验证了高质量视频合成能力。
- 使用本模型作为数据引擎,将 π0.5 策略在真实世界 OOD 任务成功率从 36.9% 提升至 63.2%,增幅达 26.3 个百分点。
与基线对比的深度解读
- 以往方法通常用少量机器人数据微调基础模型,导致大规模预训练视觉知识被遗忘;Xiaomi-Robotics-U0 通过联合优化多种生成任务,有效保留了预训练泛化性。
- 与 GPT-Image-2.0 的对比显示,专为具身设计的结构化可控迁移(structured, controllable embodied transfer)和多视角一致性生成是关键优势。
- π0.5 基准的提升证明合成数据缩放策略可行,该模型可作为可扩展数据引擎,赋能具身智能的策略学习。
行业影响
落地场景
Xiaomi-Robotics-U0 的统一具身合成能力可服务于多类产品与业务:
- 机器人数据引擎:为工业机械臂、服务机器人、仓储物流机器人提供多视角、多形态的合成训练数据,大幅扩展长尾场景覆盖。
- 仿真与数字孪生:生成高保真、几何一致的虚拟操作环境,替代部分高价实物采集流程。
- AR/VR 内容生成:产出第一人称交互视频,用于远程协作或沉浸式培训。
- 自动驾驶与具身操作交叉领域:可控地生成复杂交互场景,辅助 Corner Case 扩充。
商业价值
- 降本增效:将分布外任务成功率从 36.9% 提升至 63.2%,意味着真实数据采集与标注成本可大幅缩减,同时加速策略迭代。生成数据边际成本极低,打破“海量真实交互数据”的瓶颈。
- 产品竞争力提升:在具身场景生成与具身迁移的人类评估中超越 GPT-Image-2.0,并能保持多视角一致性与交互动态,直接增强机器人产品的泛化可靠性,缩短从研发到量产的周期。
- 新商业模式:可封装为“世界模型即服务”(WMaaS),对外输出结构化、可控的具身合成 API,按调用量或场景复杂度计费。
与现有产品/工作流的接口
- 训练流水线集成:作为数据引擎直连策略训练框架(如模仿学习、强化学习),输出带标注的
<scene, action, outcome>三元组视频或图像序列。 - 仿真器对接:生成的 RGB、深度、分割图可直接注入 Isaac Sim、PyBullet 等平台,丰富虚拟环境的纹理与布局多样性。
- 模型推理栈:支持 FlashAR + vLLM 集成,轻量推理模式可部署在云端 GPU 或本地工作站,与现有 CI/CD 和数据管理工具(如 Weights & Biases)联动。
- 标注管线复用:遵循统一标注规范,生成数据格式兼容通用数据集标签体系,可直接融入已有训练流程而无须额外适配。
具体落地 Use Case
- 电商仓储的灵巧抓取:某自动分拣系统利用 U0 生成数百种透明、反光、变形物体在箱体中的多视角抓取视频,结合域随机化策略,训练抓取模型应对复杂视觉条件,将新品类上线时间从 3 周压缩至 1 天。
- 家庭服务机器人的整机操作:机器人厂商通过 U0 的具身迁移功能,将对开门冰箱的开闭操作迁移至抽屉式烤箱,生成适配新家庭环境的连贯交互视频,作为先验策略注入模仿学习,减少家庭实地采集次数 80% 以上。
局限
- 模型规模与推理开销:Xiaomi-Robotics-U0 参数量高达 38B,自回归架构虽集成了 FlashAR 和 vLLM 加速,但实时推理仍要求高算力,难以部署到低延迟在线系统或边缘设备。训练所需的海量数据和计算资源也显著提高了复现门槛,限制了社区广泛验证与迭代。
- 动态交互的长期一致性:尽管单步和顺序生成质量领先,但对于长时程交互任务,物理一致性(如物体持久性、运动轨迹的长期稳定性)尚未经过严格检验。文中具身视频生成仅评估了较短片段,复杂遮挡、物体形变等场景下的生成可靠性仍是开放问题。
- 数据依赖与泛化边界:模型高度依赖精心构建的多模态具身数据集,其性能可能与数据质量和覆盖度强相关。当遇到全新机器人形态或任务分布严重漂移时,生成质量可能显著下降。实验中虽覆盖了多种机器人,但类型仍然有限,泛化至四足、移动底座等其他具身载体需进一步验证。