DexJoCo: 基于 MuJoCo 的任务导向灵巧操控基准与工具包
实现人类级别的操控需要具备复杂物体交互能力的灵巧机器人手。为进一步推动这一能力的发展,标准化的基准测试平台对于系统评估至关重要。然而,现有灵巧操控基准缺乏能反映灵巧手相对于平行夹爪独特操控能力的任务,也缺少全面的评估流程。 本文提出 DexJoCo,一个面向任务导向灵巧操控的基准与工具包,包含 11 个功能导向任务,评估工具使用、双手协调、长时程执行和推理能力。我们开发了低成本数据采集系统,收集了 1.1K 条轨迹,并支持域随机化以评估鲁棒性。在现代模型上,我们进行了多种设置下的基准测试,包括视觉与动力学随机化、多任务训练和动作头适配。 通过广泛的实证分析,我们揭示了当前策略在灵巧操控中的若干重要洞见与常见局限,突出了灵巧手机器人学习的未来关键挑战。项目页面: https://dexjoco.github.io
论文精读
TL;DR DexJoCo 构建了包含 11 项功能任务的灵巧操作基准与工具包,覆盖工具使用、双臂协同与长时程执行,并提供低成本遥操作数据收集系统,系统评估揭示现有模型在精细动作、插入及记忆等方面的关键局限。
问题
灵巧手操控 (Dexterous Manipulation) 正成为通用机器人研究的焦点,业界迫切需要通过标准化的基准系统性地评估算法在复杂任务上的表现与泛化能力。
现有基准的局限
- 任务设计缺乏功能性:多数现有基准(如
Adroit、DexMV)仅包含简单的抓取或旋转,未能体现灵巧手相较于平行夹爪的独特能力,如精细指动、工具使用与双手协调; - 评估维度单一:缺乏对长期执行、推理能力以及鲁棒性(视觉/动力学随机化)的系统测试,无法反映策略在真实环境中的适应性;
- 数据瓶颈:高质量遥操作数据采集成本高昂,导致可用的演示轨迹数量有限(通常仅数百条),阻碍了模仿学习与多任务训练的有效开展;
- 模型基准零散:没有统一的工具链和实验协议,不同方法之间的对比难以公平复现。
核心挑战与业界关注度
灵巧手的高自由度(如 Shadow Hand 有 24 个关节)使状态-动作空间极度复杂,策略需同时处理细粒度接触推理与长期规划,这放大了复合误差 (compound error) 与 sim-to-real gap。业界投资大量资源于通用操控模型(如 RT-2、π0),但若无针对性强的基准来暴露模型在插入、记忆等精细动作上的弱点,则算法迭代会陷入盲目。
作者指出:“existing dexterous benchmarks lack tasks that reflect the unique manipulation capabilities of dexterous hands…”,这直接点出了社区对功能型基准的急切需求。
行业类比
如同 ImageNet 为视觉模型确立评判标尺,或 DeepMind Control Suite 统一了强化学习验证,灵巧手社区同样需要一套功能完备且低成本的基准。DexJoCo 通过提供 11 个蕴含工具使用、双手协同和长序列执行的任务,并开源数据采集方案与完整评估管线,有望成为该领域的 “操控难题集”,加速从学术原型到工程落地的转化。
核心洞察
- **功能导向的任务设计** 填补了灵巧手基准中缺失的“能力特异性”评估。现有灵巧操作基准(如 DexMV、DexManipNet)多聚焦于抓取或简单物体重定向,未能充分利用多指手的灵活性。DexJoCo 的 11 个任务明确涵盖工具使用、双手协调、长时程执行与推理,这些任务形态更能体现灵巧手相对于平行夹爪的不可替代价值。这种设计迫使模型走出单一抓取范式,真正触及灵巧操作的核心挑战,为后续算法开发指明了更实际的目标。
- **低成本数据采集系统与域随机化评估协议** 提供了贴近真实落地的测试环境。不同于仅提供静态数据集的基准,DexJoCo 作为工具包集成了基于抓取手套的低成本遥操作硬件方案和一致的评估 pipeline,支持视觉与动力学随机化。对多类现代模型的系统测试揭示了关键权衡:保留预训练的动作头在多任务微调后表现更好;多任务联合训练反而导致性能退化;精细插入与长期记忆仍是普遍瓶颈。这些洞察直接指导工程部署——需要重视架构选择、数据配比,而非简单堆叠规模。
- **VLA 模型的语言泛化失效** 挑战了常识性指令理解的假设。实验中 π₀.₅ 虽在鲁棒性指标上突出,但面对未见过的语言指令时无法正确执行,说明模型仅捕获了指令与动作的统计共现,而非语义理解。这对于交互式灵巧操控产品意味着,纯端到端的 VLA 尚不可靠,需要引入更强的指令对齐机制或解耦的语义模块。该发现为 VLA 基准补充了指令-行为语义对齐的新评估维度。
方法
整体流程
DexJoCo 基准聚焦于功能导向的灵巧操作,其方法链条可概括为:任务设计 → 数据采集 → 多样环境配置 → 策略评估。
输入:任务定义与观测空间
每个任务以语言指令和目标状态作为高层输入,同时提供从模拟器中获取的多模态观测:
- 本体感知:灵巧手关节角度、关节速度、指尖力/力矩;
- 视觉输入:多视角 RGB 相机图像,支持域随机化后的鲁棒性测试;
- 物体信息:目标物体的 6D 位姿、接触点等(部分任务作为特权信息)。
关键模块
1. 任务设计原则
DexJoCo 构建了 11 项功能接地任务,这些任务强调灵巧手相对平行夹爪的独特能力:
- 工具使用(如锤子敲击、扳手拧螺丝);
- 双手协调(如双手抓取、传递);
- 长时程执行(需多步推理的任务链);
- 推理能力(根据语言指令动态调整策略)。 所有任务在 MuJoCo 物理引擎中实现,并提供标准化资产,确保可复现性。
2. 低成本数据采集系统
为获取人类演示,设计了一套遥操作系统,硬件包含:
- 主端:低成本的 VR 控制器映射人手动作;
- 从端:仿真中的 Shadow Hand 或等效五指灵巧手。 通过逆运动学求解将人手轨迹重定向到灵巧手,采集了 1.1K 条完整轨迹,涵盖全部任务。这套系统显著降低了灵巧操作数据获取的门槛。
3. 域随机化与鲁棒性评估
DexJoCo 内置了两种随机化机制:
- 视觉随机化:改变光照、相机位置、纹理等,测试对视觉扰动的鲁棒性;
- 动力学随机化:调整质量、摩擦系数、关节阻尼等物理参数,考验策略的物理泛化性。 这些选项可在训练时启用,以生成多样化的分布内(in-distribution)和分布外(out-of-distribution)场景。
4. 基线策略与评估设置
基准提供了多种模仿学习基线,并在以下维度进行对比:
- 单任务 vs. 多任务训练:考察模型在多任务设置下的性能退化;
- 动作头适应:对比保留预训练模型的 action-head 与重新训练的效果;
- Vision-Language-Action (VLA) 模型:评估如 π₀.₅ 等模型的语言泛化能力(论文发现其未能展现跨任务的指令泛化)。
输出:性能指标与洞察
评估输出成功率、操作精度等常规指标,并重点报告在域随机化下的性能衰减和多任务冲突趋势。通过大规模实证分析,DexJoCo 得出了关键结论:
- 现有策略在精细动作、插入类任务、长时间记忆任务上普遍存在失效;
- 预训练规模与架构选择对灵巧操作存在 trade-off;
- 保留预训练动作头通常有助于提升鲁棒性。
与同类灵巧操作基准(如 DexMV、HumanPlus)相比,DexJoCo 的核心差异在于其任务设计强调功能实用性而非单纯的操作演示,并内置了完整的域随机化评估管线和工具包,使得研究者能快速、公平地测试灵巧手策略的泛化边界。
实验
实验设计
DexJoCo 在 11 项功能导向任务上评估现代模仿学习策略,涵盖工具使用、双手协调与长时程执行。实验设置多种域随机化(视觉/动力学参数扰动)以检验鲁棒性,并考察多任务联合训练与动作头适配(保留/重置预训练动作头)对性能的影响。数据包含 ~1.1K 条人类遥操作示教轨迹,覆盖单任务与多任务场景。
关键发现
- 域随机化暴露策略局限:当前模型在细粒度动作(如精密插入)、长时记忆与动态扰动下普遍失效,表明鲁棒性仍远不及人类。
- 多任务训练导致性能退化:联合训练多个任务时,单一策略的准确率与成功率显著下降,表明不同任务的梯度冲突与容量分配是核心瓶颈。
- 预训练规模与架构的权衡:更大的预训练模型并不总能带来提升,轻量架构结合针对性的任务微调有时更优。
π0.5展现更强的抗扰动能力:该变体在动力学随机化下保持较高成功率,其设计可能为鲁棒操控提供参考。- 保留预训练动作头优于随机初始化:在视觉随机化测试中,冻结或微调预训练动作头能大幅减缓性能下降。
- VLA 模型未实现语言泛化:视觉-语言-动作模型在未见语言指令下几乎完全失效,说明当前多模态融合尚停留在表层匹配,缺乏语义组合能力。
与基线对比的深度解读
实验并未固定单一基线,而是通过系统性消融揭示共性缺陷。与传统单任务模仿学习相比,多任务训练普遍下降,印证了操控任务的高冲突特性。与仅依赖视觉抗噪的模型相比,动力学随机化带来更剧烈的性能跌落,提示力学感知与顺应控制的缺失。VLA 模型的泛化失败则直指语言 grounding 的脆弱性,与近期大模型在桌面操作上的成功形成反差,说明高维连续操控对语义到动作的对齐提出了更高要求。这些发现共同指出,未来研究须突破独立同分布假设,着力于多任务冲突缓解、多模态深层次融合以及动力学先验的注入。
行业影响
落地场景
DexJoCo 提供了面向灵巧手的标准化任务集和评估工具,直接指向工业界中需要精细操作、多指协调、长周期执行的场景:
- 仓储与物流:灵巧手抓取异形件、包装、拆垛。DexJoCo 中的
bin-picking、grasp-and-place等任务可用于测试算法在随机化物品种类下的泛化能力。 - 服务与医疗机器人:工具使用(如拧螺丝、插拔、按钮操作)是家庭服务、手术辅助的核心。DexJoCo 的
tool-use任务有助于训练精细动作策略。 - 柔性制造:小批量、多品种产线的装配任务,如连接器插拔、线缆布线,灵巧手相对于平行夹爪能更好地应对复杂几何外形。任务中的
bimanual双手协调任务可验证双臂协作能力。
商业价值
- 降低数据与验证成本:项目提供低成本的人类遥操作数据采集方案和 1.1K 条示范轨迹,企业无需独立搭建昂贵的动捕系统即可获得模仿学习基线。
- 加速原型迭代:完备的基准与领域随机化(视觉/动力学)评估,让策略的鲁棒性验证可在仿真阶段完成,减少真机调试的试错成本。
- 模型选型与优化指导:论文通过多任务训练、动作头自适应等实验揭示了预训练大模型、架构规模的权衡,帮助企业决策采用 VLA 模型(如 π0.5)还是精调专用策略,从而优化资源投入。
与现有产品/工作流的接口
DexJoCo 基于 MuJoCo 仿真,兼容主流 RL 和模仿学习框架,便于集成到已有 MLOps 管道:
- 可直接通过 Gymnasium 风格的 API 加载环境,与现有训练脚本(如 Stable-Baselines3, robomimic)对接。
- 提供示例化的
imitation_learning基准配置和模型部署样例(GitHub),团队可在此基础上修改状态空间、奖励函数,快速适配自有硬件。 - 支持 多任务训练 和 视觉语言指令,可与大模型(如 GPT-4o)规划接口结合,实现零样本或少样本技能迁移,嵌入基于语言的“规划-执行”机器人软件栈。
典型应用案例
- 电商仓储拣选:利用 DexJoCo 的
bin-picking任务训练灵巧手从料箱中抓取个性化商品,再通过place任务完成打包。领域随机化可模拟不同光照和物体摩擦系数,策略直接部署到真实机械臂。 - 手术器械操作模拟:在各类手术培训系统或器械研发中,灵巧手精细工具操作基准可用于训练和评估自主操作策略,如穿针引线、器械交接,在安全仿真中反复试错。
局限
- **仿真与现实差距**:DexJoCo 完全基于 MuJoCo 仿真环境,缺乏在真实机器人上的部署与验证。尽管通过域随机化(视觉、动力学)测试策略的鲁棒性,但仿真到真实(sim-to-real)的迁移鸿沟仍未被弥合。低成本的遥操作数据采集系统依赖硬件设计,未讨论其抗噪声能力及对真实环境的适配性,基准的实际适用性因此受限。
- **数据规模与任务覆盖**:数据集仅包含 1.1K 条人类演示轨迹,规模相对较小,难以充分训练泛化性强的策略。11 个任务虽覆盖工具使用、双手协调等维度,但未涉及更多样化的物体材质、形状及复杂接触动力学(如易形变物体),可能不足以反映现实灵巧操作的全部挑战,尤其限制了模型对未见物体的零样本泛化能力。
- **评估范式与模型范围**:基准目前仅聚焦于模仿学习(行为克隆)为基础的策略评估,未整合强化学习或基于模型的方法,使得比较分析不够全面。实验中 VLA 模型未能展现语言泛化能力,侧面反映基准在语言引导的灵巧操作任务设计上仍有不足,对指令跟随和语义理解的要求较浅,限制了多模态策略(如视觉-语言-动作)的充分评测。