论文

Xiaomi-Robotics-1:扩展超过10万小时真实世界轨迹的视觉-语言-动作模型

Xiaomi-Robotics-1:扩展超过10万小时真实世界轨迹的视觉-语言-动作模型

我们提出 Xiaomi-Robotics-1,一个基础视觉-语言-动作(VLA)模型,具备两大能力:(1) 在未见环境中开箱即用地遵循多样化语言指令执行各类移动操作任务;(2) 通过极少量微调数据高效适应新的下游任务。 我们提出两阶段训练流程,包括预训练和后训练。在预训练阶段,通过训练超过10万小时、使用 UMI 设备收集的真实世界操作轨迹,赋予模型广泛且可泛化的动作生成能力。关键创新是开发了一个可扩展的自动标注管线,用自然语言描述场景状态转换,为动作学习提供丰富精确的条件。在后训练阶段,旨在将这些能力与机器人实体和人类自然使用的指令对齐。 大量实验展示了强缩放行为。预训练中,Xiaomi-Robotics-1 随着数据规模和模型大小的增加持续改进,且该行为直接迁移到后训练——更强的预训练模型在未见环境中产生更好的开箱即用性能。此外,Xiaomi-Robotics-1 可作为强机器人基础策略,在复杂灵巧任务上高效微调。在多个仿真基准中,它均超越现有最优方法:在 RoboCasa365 上达到 57.6% 成功率(此前最佳为 46.6%);在 RoboDojo 上平均得分 20.07,显著超越之前最优的 13.07。代码与模型权重将开源。

论文精读

TL;DR Xiaomi-Robotics-1 用超 10 万小时真实机器人操作轨迹预训练 VLA 模型,通过自动标注流水线生成语言描述,实现了零样本泛化操作和高效下游微调,多项 benchmark 取得新 SOTA。

问题

问题背景

当前机器人学习领域的核心追求是构建通用机器人基础模型,使其能通过自然语言指令在未见过的环境中直接执行多样化的移动操作任务,并具备快速迁移到新任务的高数据效率。

现有方法局限

现有视觉-语言-动作(VLA)模型多受制于数据瓶颈:

  • 数据规模与多样性不足:依赖仿真数据或小规模真实采集,难以覆盖真实世界的场景变化与物体交互模式,导致sim-to-real gap明显;
  • 语言监督质量低下:动作序列缺乏细粒度的自然语言标注,模型仅能学习粗粒度的任务描述,无法理解动作与场景状态变化的因果关联;
  • 泛化与适应能力割裂:多数模型要么追求零样本泛化但牺牲下游任务精度,要么针对单任务训练,缺乏统一框架同时实现开箱即用泛化高效微调

技术挑战与重要性

问题的难点在于:

  1. 规模化数据获取:真实机器人轨迹的采集成本极高,且需覆盖海量环境、物体与任务组合;
  2. 自动化细粒度标注:为每个轨迹片段生成描述状态转移的自然语言,要求标注既准确又具有可扩展性;
  3. 指令对齐:人类下达的命令通常是祈使式(“拿起杯子”),而动作学习常基于状态变化描述,两者存在语义鸿沟,需显式对齐;
  4. scaling law验证:在具身智能中,数据量、模型规模的扩展性尚未在大规模真实数据上得到充分验证。

业界高度关注该方向,因为成功的VLA基础模型将大幅降低机器人部署的工程门槛,推动从固定产线到灵活服务的跨越,类似基础语言模型对NLP领域的变革

核心洞察

  • **大规模真实世界轨迹数据的自动标注流水线** 实现了从海量 UMI 设备采集的 100k+ 小时操作轨迹中,自动生成描述场景状态转换的自然语言标注。这解决了机器人 VLA 模型训练中长期面临的高质量语言-动作配对数据稀缺的瓶颈,与依赖人工标注或模板生成的方法相比,不仅成本极低,而且能够捕捉到更丰富、更精确的环境动态与操作语义,为动作模型提供了更细粒度的 conditioning,是扩展真实世界机器人学习的关键工程突破。
  • **预训练到后训练的可扩展性无缝迁移** 使模型在面对全新环境和任务时,性能随预训练数据和模型规模的增加而持续提升,无需额外后训练阶段的重新缩放。这不同于许多仅展示单个阶段缩放定律的工作,本文证明更强的预训练 VLA 基座直接转化为更强的零样本泛化能力,为构建通用机器人基础模型提供了清晰的规模化路径:优先投入预训练数据和计算资源,即可高效获得下游任务的高起点表现。

方法

核心架构:两阶段 VLA 训练范式

Xiaomi-Robotics-1 采用 视觉-语言-动作(VLA) 模型,遵循「多模态感知 → 条件动作生成 → 任务对齐」的端到端流水线。

输入: 多视角摄像头序列 + 自由格式语言指令(如“打开左侧抽屉并放入物体”)。

关键模块与训练流程:

  1. 预训练阶段——目标是注入广泛的物理交互常识:

    • 100k+ 小时真实世界操作轨迹上训练,数据通过 UMI 手持设备 跨海量场景采集,覆盖多样任务。
    • 核心创新:可扩展自动标注流水线 将轨迹片段转化为描述 场景状态转换 的自然语言(如“物体从桌面移动到抽屉内”),而非简单的任务标签。这提供了精确的 状态变化条件信号,显著提升动作学习的泛化性。
    • 模型学习从视觉历史和当前状态预测未来动作序列(如末端执行器位姿)。架构上推测为 Transformer 基座,将视觉 token 与语言 token 融合后自回归生成动作 token。
  2. 后训练阶段——目的是对齐机器人实体与人类指令习惯:

    • 使用 命令式指令(如“把杯子收进柜子”)对预训练模型进行微调,将描述性状态理解映射到可执行的任务驱动动作
    • 同时适配特定机器人本体(如移动操作平台)的动作空间与物理约束。

输出: 可即时部署于新环境的 通用操作策略,能直接响应自然语言指令,无需环境特定训练。另提供高效 下游微调接口,仅用少量数据即可适应灵巧操作等新任务。

与同类方法差异: 不同于 OpenVLA 等依赖互联网图文数据与少量机器人数据的方案,Xiaomi-Robotics-1 完全基于 超大规模真实操控轨迹 进行预训练,并通过 状态转换自动标注 构建细粒度语言条件,显著提升了物理交互的泛化能力与 scaling 效率。

实验

实验设计

实验围绕两阶段训练展开:

  • 预训练阶段:使用超过 100K 小时 的真实世界操作轨迹(通过 UMI 设备采集)训练基础 VLA 模型,核心是开发可扩展的自动标注管道,为轨迹片段生成描述场景状态转换的自然语言标注,提供精确的动作学习条件。
  • 后训练阶段:将预训练模型与机器人本体和人类常用的指令式任务提示对齐,使模型能够理解“开箱即用”的任务指令。
  • 评估维度:在未见过的真实环境中测试开箱即用性能,并在仿真基准(RoboCasa365、RoboDojo)上对比 SOTA;同时验证模型在下游任务上的微调数据效率

关键发现

  • 缩放行为强烈:预训练阶段,模型性能随数据量和模型尺寸增加而持续提升,且该缩放行为直接迁移至后训练——更强的预训练基础模型在未见环境中的开箱即用真实机器人性能更优。
  • 自动标注有效:所提出的自动语言标注管道为大规模真实数据提供了丰富的监督信号,使得动作学习能够以状态转换描述为条件,而不是简单任务标签。
  • 高效适配:模型可作为强大的机器人基础策略,只需少量微调数据即可快速适配复杂的灵巧操作任务,数据效率显著。

与基线对比的深度解读

  • RoboCasa365 上,Xiaomi-Robotics-1 达到 57.6% 成功率,大幅超越此前最佳 46.6%,提升超过 11 个百分点,表明大规模真实预训练有效弥补了仿真到真实的 gap。
  • RoboDojo 上,平均分 20.07 vs 之前 SOTA 的 13.07,领先幅度超过 50%,证明了模型在复杂灵巧操控上的泛化能力。
  • 对比其他机器人基础模型,该工作的优势源于两个关键设计:(1) 100K 小时级真实数据 提供了丰富的场景覆盖;(2) 自动标注的状态转换语言 使指令跟随更精准,而非依赖简单任务 ID。这为 scaling VLA 模型提供了可复现的范式。

行业影响

落地场景

Xiaomi-Robotics-1 作为移动操作基础 VLA 模型,直接面向开放环境下的语言指令操控机器人,尤其适用于仓储物流、智能家居、商业清洁等需要泛化抓取与移动操作的产品。该模型能在未见过的工作空间“开箱即用”执行任务,例如根据语音指令从货架上取放杂货、整理办公室物品,或在厨房中完成多步骤物料搬运。对于需要频繁应对新布局和新物品类目的应用,传统编程方法维护成本极高,而大模型策略可显著降低部署门槛。

商业价值

模型基于 10 万小时真实轨迹 训练,展现出 data scalingmodel scaling 的强收益:预训练数据量增加直接提升后训练阶段的零样本真机成功率,因此其商业价值沿降本增效主线展开。一方面,减少每场景定制开发与数据采集成本,使方案能快速铺开到多客户场地;另一方面,高数据效率的微调(仅需少量演示即可适配复杂灵巧任务)意味着客户可自行扩展新技能,避免持续依赖供应商,从而降低长期 TCO。此外,在 RoboCasa365(57.6% 成功率)和 RoboDojo(20.07 分)等仿真基准上超越前代 SOTA,证明模型在通用性上的领先,可形成技术壁垒。

与现有产品/工作流的接口

该模型以 VLA 架构输出动作,可集成进现有机器人控制栈:通过替换传统规划模块或作为高层控制器,搭配底层运动控制与感知管线。项目主页已开源代码与检查点,便于在 ROS 2 生态中原型验证。预训练的 VLA 可作为“机器人基础策略”,通过微调适配特定本体(如轮式移动底盘 + 机械臂),与视觉 SLAM、导航栈协作,形成完整的移动操作方案。自动标注管线生成的场景状态转变描述,也为构建大规模机器人数据集提供了工具,可融入企业现有数据闭环,持续迭代模型。

具体落地用例

  • 电商履约中心:部署移动操作机器人处理退货分拣,面对层出不穷的商品包装与形状,模型仅需自然语言指令(“把该商品放入退货框”)即可执行,并通过微调快速学习特殊抓取方式,大幅缩短仓库改造周期。
  • 商业楼宇配送:在酒店或写字楼内,机器人根据语音请求送物、取件,模型可泛化到不同楼层的房间布局与物品类别,并与电梯调度、门禁系统通过 API 集成,提供 7×24 无人值守服务,提升物业运营效率。

局限

  • - **数据收集依赖 UMI 手持装置**:10 万小时真实轨迹通过 UMI 手持夹爪收集,虽成本低于传统遥操作,但仍需大量人工演示,数据分布受限于演示者的技能和任务多样性,难以覆盖长尾边缘场景。这不仅约束了数据扩展的上限,也可能导致模型在未见场景中的鲁棒性不足。
  • - **自动标注管线的噪声影响**:预训练的语言标签由 VLM 自动生成,描述场景状态转换,其质量直接决定模型对语言指令的理解精度。若 VLM 在细粒度操作描述上出现偏差,会引入噪声,使预训练目标不够精确,后训练阶段虽能部分对齐,但无法完全消除误导,可能在某些语言指令下产生不合理的动作输出。
  • - **跨形态泛化未验证**:模型在特定移动操作平台上表现优异,但训练数据和评测环境均基于该形态。对于与训练数据差异较大的机器人形态(如多指灵巧手、腿式移动底盘),其泛化能力未经实验检验,且后训练仅做指令对齐,未涉及跨形态策略迁移,限制了其作为通用机器人基础模型的潜力。
论文Xiaomi Robotics Team2026-07-16原文

相关内容