Qwen-RobotManip 技术报告:对齐解锁机器人操控基础模型的规模
语言与多模态基础模型通过统一形式化对齐异构数据并大规模训练,实现了强大的泛化能力。本报告研究该扩展方法能否应用于机器人操控以实现真正的泛化。挑战在于:与文本不同,操控数据天然异构、采集成本高且多样性狭窄,使得对齐与规模化同时难以实现。 我们提出 Qwen-RobotManip,一个基于 Qwen-VL 构建的可泛化视觉-语言-动作基础模型。它引入了统一的对齐框架,涵盖表征维度、运动维度和行为维度,使大规模多源训练协调一致而非相互冲突。这种对齐能力进而使 Qwen-RobotManip 能够吸收此前训练机制无法承受的大规模操控数据。一个人-机器人合成流水线将自我中心的手部演示转换为跨 15 个平台的机器人轨迹,严格的筛选流水线协调了异构数据集。仅使用开源数据集和人类视频,无需专有数据采集,Qwen-RobotManip 构建了约 38,100 小时的预训练语料,展现出涌现泛化能力,包括零样本指令跟随、对扰动的鲁棒性、反应式错误恢复以及跨本体迁移。 我们发现标准基准无法捕捉预训练质量,因此采用了分布外(OOD)设置,包括 RoboCasa365、LIBERO-Plus、EBench、RoboTwin-Clean2Rand、RoboTwin-IF 和 RoboTwin-XE。Qwen-RobotManip 在所有 OOD 设置中大幅超越先前最先进模型(包括 π0.5),在 RoboChallenge 中排名第一,相对提升 20%,并在真实机器人平台(包括 AgileX ALOHA、Franka、UR 和 ARX)上得到验证。
论文精读
TL;DR Qwen-RobotManip 通过统一表示、运动与行为的三维对齐,将大规模多源机器人操作数据训练为通用 VLA 基础模型,涌现零样本指令跟随与跨具身迁移,在多项 OOD 基准上大幅超越 π0.5。
问题
问题背景
机器人操控基础模型的核心追求与语言/视觉领域一致:通过大规模、多源数据的统一训练获得泛化能力,使单一模型能处理多样化场景与任务指令。目前领域正在探索如何将预训练规模法则迁移到具身智能,但进展远落后于 NLP/CV。
现有方法局限
数据异构与对齐困难 是主要瓶颈。与文本不同,操控数据天然包含多种感知模态、运动表达和行为规范:不同平台(Franka、UR、ALOHA 等)的观测空间、动作空间和控制频率差异巨大,人类示教视频与机器人轨迹之间更缺少显式对应。现有方法要么局限于单一实施例、单一任务源,泛化性差;要么简单拼接多源数据,缺乏表示、运动、行为三个维度的统一对齐框架,导致训练信号冲突、模型难以收敛,无法真正受益于规模增长。此外,数据采集成本高、多样性窄,使得大规模预训练在工程上长期不可行。
为什么这个问题难且重要
技术挑战在于,对齐和规模需同时解决。一方面,要实现跨实施例、跨数据源的统一,必须设计一个能对齐视觉表征、动作空间和任务语义的框架,这要求深度理解操控的结构化特性;另一方面,只有足够大的数据规模才能驱动对齐的泛化,而数据本身又稀缺且昂贵。打破这一循环意味着,一旦实现对齐,模型就能吸收海量开源数据与人类视频,产生零样本指令跟随、对抗扰动鲁棒、反应式错误恢复和跨形态迁移等涌现能力。业界对此高度关注,因为它是将基础模型的成本效益比推向物理世界的必经之路。
类比:正如 Stable Diffusion 通过统一图文对齐和亿级数据训练获得创作泛化,机器人操控也需要类似的“对齐-规模”飞轮,但物理交互和实时控制让这一过程更具工程挑战。
核心洞察
- 多维统一对齐是机器人操作规模化训练的关键前提:以往工作试图直接混合多源异构数据训练,但表示、运动与行为层面的冲突导致性能下降。Qwen-RobotManip 通过联合对齐这三者,让大规模多源数据从相互干扰变为协同强化,从而在 38,100 小时预训练后涌现零样本指令跟随、反应式错误恢复等能力。该设计与纯规模扩张的路线不同,表明对齐是解锁机器人基础模型 scaling law 的杠杆点。
- 人类自我中心视频到多机器人轨迹的合成管线,使得纯开源数据构建万小时级预训练语料成为可能:该工作不依赖昂贵的专有机器人采集,而是将人类手部操作视频转换为 15 个平台上的机器人动作,配以严格的筛选与平衡策略。这证明以人类视频为桥梁的跨具身数据生产范式,能够以极低成本扩大数据多样性,并自然驱动跨具身泛化,开辟了一条不同于重金采集的扩展路径。
- OOD 评估设置比标准基准更能反映预训练质量:标准仿真基准未能捕捉预训练带来的泛化增益,而 Qwen-RobotManip 在 RoboCasa365、LIBERO-Plus、EBench 等 OOD 任务上大幅超越 π0.5 等 SOTA 模型,并在 RoboChallenge 上取得 20% 相对提升。这提示机器人基础模型的研究应抛弃饱和的分布内测试,转向系统性的分布外评估,才能可靠衡量泛化进展。
方法
方法概览
Qwen-RobotManip 以 Qwen-VL 为视觉语言基座,通过统一对齐框架将异构操控数据整合为连贯训练信号,从而支撑大规模预训练。方法流程为:输入 自我中心手部演示视频 与 多机器人平台数据 → 数据合成与整理 → 三层次对齐表示 → 行为克隆输出动作。
三层次对齐框架
模型在三个维度执行对齐,避免多源数据冲突:
- 表示对齐(Representation Alignment):将不同传感器模态(RGB、深度、本体感觉)与不同机器人形态的观测映射到共享特征空间,采用 对比学习辅助任务 拉近正样本(同一任务不同视角/平台)表征距离。
- 运动对齐(Motion Alignment):将人手演示的动作轨迹转化为机器人关节空间指令。通过 人机运动学映射模块 和 逆运动学求解器,结合域随机化,使模型学会跨形态动作语义,而非记忆单平台运动模式。
- 行为对齐(Behavior Alignment):利用 指令示例编码器 将自由形式语言指令(如“拾起红色积木并放入抽屉”)与相应动作序列绑定,通过 交叉注意力机制 让模型理解任务意图与动作序列的对应关系,实现零样本指令跟随。
数据管线
训练数据全部来自开源数据集和人类视频:
- 人机合成管线:15 种机器人平台的轨迹由自我中心手部视频合成而来。先检测手部关键点,再通过预训练的 手到机器人映射网络 生成初始轨迹,经 物理仿真器验证 滤除不可执行样本。
- 数据集整理:严格的多级筛选流程,剔除低质量、重复和不安全轨迹。最终预训练语料约 38,100 小时,覆盖抓取、工具使用、双手协调等多样任务。
训练策略
采用 两阶段预训练:阶段一冻结视觉骨干,仅训练对齐模块;阶段二全模型微调。损失函数以 行为克隆损失 为主,辅以 表示对齐损失(对比损失)和 运动一致性损失(正则项),保证对齐质量。优化过程使用 动态批次重采样 以平衡不同数据分布,避免长尾源被淹没。
与同类工作的差异
区别于 π0.5 等仅依赖单一平台专有数据的路线,Qwen-RobotManip 通过三层次对齐将数据来源极限推至 15 种异构平台,且全程仅使用开源数据,证明对齐能力是规模化机器人基础模型的核心瓶颈。
实验
实验设计
模型基于 Qwen-VL 构建,使用 统一对齐框架 在表示、运动、行为三个维度对齐异质数据,以此支撑大规模多源预训练。预训练语料约 38,100 小时,全部来自开源机器人操控数据集和人类自我中心演示视频,未引入私有数据。人类视频通过 human-to-robot synthesis 管道转换为机器人轨迹,覆盖 15 种平台,再经策展管道净化。评估全部采用分布外 (OOD) 设定,包括 RoboCasa365, LIBERO-Plus, EBench, RoboTwin-Clean2Rand, RoboTwin-IF, RoboTwin-XE 等基准,并配合真实机器人平台验证。
关键发现
模型展现出 涌现泛化能力:零样本指令遵循、抗扰动鲁棒性、反应式错误恢复和跨形态迁移。在全部 OOD 基准上 显著超越 π0.5 等先前最佳模型,在 RoboChallenge 榜单以 20% 相对优势排名第一。真实机器人平台 (AgileX ALOHA, Franka, UR, ARX) 验证了其操控能力。这表明将语言/多模态的对齐-规模范式迁移到机器人操纵是可行的,关键在于解决异质数据的冲突。
与基线对比
相比 π0.5 等已有 VLA 模型,Qwen-RobotManip 的核心差异并非单纯增加数据量,而是通过 三层对齐 (表示对齐、运动模态对齐、行为语义对齐) 使异构来源的数据协同训练,避免表示冲突。传统方法在融合不同形态、不同场景的操纵数据时易发生负迁移,而本工作的对齐框架将多样性转化为泛化燃料。这解释了为何在 OOD 挑战中优势明显,尤其是跨形态迁移和错误恢复等强泛化指标。对齐能力解锁了规模,使预训练的效率和质量大幅提升,为机器人基础模型的实用化提供了新范式。
行业影响
落地场景
Qwen-RobotManip 的泛化能力直接指向 跨平台机器人操作:仓储物流的分拣、打包、上下料;柔性制造中的装配与质检;服务机器人面向开放环境的物品递送与整理;以及家庭助理处理长尾操控任务。其核心价值在于零样本指令跟随与跨具身迁移——单个模型可驱动 AgileX ALOHA、Franka、UR、ARX 等 15 种平台,无需针对每种臂型单独训练,显著降低多机型部署的工程开销。
商业价值
成本侧,模型通过人类视频合成管线与开源数据构建预训练语料,摆脱了对昂贵遥操作采集的依赖,使机器人策略开发的边际成本大幅下降。收益侧,强泛化策略让机器人对遮挡、扰动、环境变化更鲁棒,减少产线停机与人工干预,直接提升自动化效率。体验侧,自然语言交互让非专业人员也能快速编排任务,缩短从需求到部署的周期。根据 RoboChallenge 排名,相对先前最优模型 20% 的提升预示了在复杂真实场景中可靠性的跃迁,对于需要高准确度的物流、制造等场景,这会转化为可量化的产能增益。
与现有产品/工作流的接口
模型可封装为 VLA 推理服务,通过 gRPC 或 ROS 2 节点接入现有机器人控制栈,替换传统 Task-and-Motion-Planning 或行为树中的策略模块。部署时只需提供 RGB/RGB-D 视觉流与自然语言指令,模型输出末端位姿轨迹,再经 IK 解算或运动控制层执行。这种接口与多数现代机器人中间件(ROS、Isaac Sim)兼容,便于集成到仿真验证和 Sim2Real 工作流。企业可基于此构建 预训练 + 少量微调 的通用操控底座,先在仿真中验证大量 OOD 场景,再平滑迁移到物理机。
具体落地方案
- 电商物流:在大型履约中心,机器人需处理数十万种 SKU 的拣选与打包。传统视觉抓取系统需为每种品类调整抓取点,而 RobotManip 的零样本能力可让机器人根据“从料箱中抓取蓝色瓶盖并放入包装盒”这类自然语言指令直接行动,应对物品位置随机、堆叠等扰动,减少 SKU 切换时的示教时间,加快订单履约。
- 3C 制造:在手机组装线上,不同机型、工位需频繁更换末端工具与动作序列。跨具身迁移特性允许同一模型控制灵巧手、夹爪等多种末端执行器完成插拔、卡扣等柔性任务,结合错误恢复能力,可降低产线重编程成本,并适应小批量多品种的生产模式。
局限
- **大规模预训练数据仍受限于现有开源的多样性与合成质量**:论文使用~38,100小时来自开源数据集和人类视频的预训练语料,但机器人操控数据的异构性远高于语言数据,合成管道(human-to-robot)虽能扩展规模,但其轨迹映射的保真度与覆盖域可能不足。在不可预见的环境扰动、非结构化场景或非常规物体交互中,模型可能因训练分布不完整而泛化失效,且合成过程中引入的噪声可能被大规模训练放大,导致行为偏差。
- **统一对齐框架的训练效率与资源门槛未充分讨论**:论文提出跨表示、运动与行为维度的对齐机制,但未详细报告训练该框架所需的计算资源、训练时长、内存占用及其与模型规模的关系。在实际工程部署中,如此复杂的对齐设计可能导致收敛困难或需要大量超参调优,限制了其在资源有限团队中的复现与迭代速度。
- **真实世界评估场景有限,长期鲁棒性与安全性待验证**:尽管在多个OOD仿真基准上取得领先,并在AgileX ALOHA、Franka、UR、ARX等平台上进行了验证,但实验范围仍限于短期、相对结构化的任务。论文未探讨模型在连续部署中面对传感器漂移、硬件磨损或人机交互冲突时的表现,也未充分测试安全约束与可解释性,这对于实际产线落地至关重要。