论文

TANGO: 在杂乱环境中使用全身视觉-语言-动作模型进行人形机器人导航

TANGO: 在杂乱环境中使用全身视觉-语言-动作模型进行人形机器人导航

我们研究人形机器人在杂乱室内环境中的导航问题。与将导航建模为 2D 路径规划的传统方法不同,人形机器人在杂乱环境中的穿越需要连续的几何感知全身自适应,包括协调的手臂放置、躯干调整和步态调节,以在复杂 3D 空间中实现无碰撞运动。我们提出 TANGO,这是首个针对语言条件化人形机器人杂乱环境穿越的全身视觉-语言导航框架。给定自然语言指令和以自我为中心的 RGB 观察,TANGO 直接预测 29 自由度关节空间动作,用于下游全身控制。 我们完全在仿真中训练 TANGO,通过全局路径规划、运动学全身运动生成、障碍物感知运动编辑和基于强化学习的跟踪,合成多样化的无碰撞穿越行为。该流程为学习语言条件化全身策略提供了动态可行的动作监督。在大量仿真实验中,TANGO 在视觉语言导航方面展现了最先进的性能,同时在需要障碍协商的挑战性场景中优于强大的模块化基线。最后,我们在 Unitree G1 人形机器人上零样本部署 TANGO,并观察到在杂乱真实世界场景中无需任何真实世界导航数据训练即可实现鲁棒的语言引导穿越。

论文精读

TL;DR TANGO 是首个全身视觉语言导航框架,直接输出 29-DoF 关节空间动作,仅用仿真数据训练即可零样本部署到人形机器人,在杂乱环境中实现语言引导的全身避障通行。

问题

问题背景

人形机器人语言引导导航是具身智能的核心任务之一,当前研究正从简单平面移动转向复杂三维室内环境中的指令执行。

现有方法局限

传统导航系统通常将问题建模为2D 路径规划,在占据栅格上求解最优路径,再由底层控制器跟踪。这种方式存在明显不足:

  • 忽略全身几何:人形机器人具有高维连续变化的身体形态,手臂、躯干、步态都会影响碰撞,2D 表示无法捕获这些约束。
  • 模块化误差累积:感知、规划、控制分离,路径规划器输出的目标点可能无法通过全身运动实现,导致卡滞或碰撞。
  • 缺乏语言-运动耦合:现有 VLN 方法多为离散动作空间或高层航点,无法直接生成关节空间动作,难以处理“侧身通过”“弯腰绕过低矮障碍”等包含身体形态调整的指令。

为什么这个问题难且重要

挑战在于几何感知的全身协调:机器人需根据 RGB 观测实时调整手臂、躯干和步态,动作空间高达 29 自由度,搜索空间巨大。同时,语言指令往往隐含对通行方式的描述,需要模型理解空间语义并映射到连续的关节轨迹。业界关注度持续上升,因为家庭服务、仓储物流等应用要求人形机器人在狭窄、杂乱的真实场景中可靠移动,单纯依赖避障路径规划无法满足需求。

行业类比

这类似于自动驾驶从车道级路径规划演进到考虑车身姿态与障碍物交互的行为规划:人形机器人需要从“点移动”升级为“全身行为合成”,将语言语义直接编译为可行的高维关节动作。

核心洞察

  • TANGO 将人形机器人导航从 2D 路径规划重新定义为全身关节级控制问题,直接预测 29-DoF 关节动作来实现语言引导的避障。其独特性在于摒弃了传统移动机器人导航的平面假设,将身体几何与实时运动学约束纳入策略,从而能够在狭窄空间中同步协调手臂放置、躯干调整和步态调制,而非仅仅规划一条二维路径。
  • TANGO 提出了一个纯仿真训练管道,通过合成多样化的无碰撞全身轨迹来生成监督信号,实现了零样本真实世界部署。与依赖真实机器人数据或手工模块化流水线的方法不同,该管道结合全局路径规划、运动学全身运动生成、障碍感知运动编辑和 RL 跟踪,产生动态可行的动作标签,有效缩小 sim-to-real 差距,展示了仅用仿真数据训练语言条件全身策略并在真机上鲁棒执行的可行性。

方法

输入与问题定义

TANGO 接收自然语言指令 和 自我中心 RGB 观测,在杂乱的室内环境中直接输出 29 自由度关节空间动作,用于下游全身控制。与传统将导航建模为 2D 路径规划的方法不同,TANGO 将身体几何状态视为导航问题的一部分。

关键模块

训练完全在仿真中完成,核心是合成多样化无碰撞穿越行为的监督管线:

  1. 全局路径规划 :生成高层导航目标路径。
  2. 运动学全身运动生成 :根据路径生成协调的手臂放置、躯干调整和步态调制。
  3. 障碍感知运动编辑 :对生成的运动进行编辑,保证在复杂 3D 空间中无碰撞。
  4. RL 跟踪 :基于强化学习跟踪编辑后的运动,提供动态可行的动作监督。

该管线为语言条件全身策略提供 动作监督信号。之后 TANGO 通过 视觉-语言-动作模型 学习从 RGB 和指令直接预测关节动作。部署时无需真实导航数据,零样本迁移到 Unitree G1。

与同类方法差异

端到端从感知到关节动作的直接预测,避免了模块化方法中的显式 2D 规划和中间表示转换,更适应复杂 3D 杂乱环境。

实验

实验设计

TANGO 在仿真环境和真实世界进行了系统验证。仿真实验覆盖 视觉语言导航 (VLN) 基准和杂乱环境穿越任务,同时进行了消融研究;真实世界实验将模型零样本部署到 Unitree G1 人形机器人,测试语言引导的穿越能力。

关键发现

  • 在 VLN 任务上,TANGO 取得了 state-of-the-art 性能,表明联合建模语言、视觉和全身动作是有效的。
  • 在需要障碍物协商的杂乱场景中,TANGO 显著超越强模块化基线,验证了端到端全身控制的优势。
  • 零样本部署到真实机器人后,TANGO 在不依赖任何真实世界导航数据的情况下,仍能鲁棒地执行语言引导的穿越任务。

与基线对比

传统模块化方法将导航分解为感知、路径规划和局部控制等步骤,各模块独立优化,误差容易累积,且难以处理全身几何约束。TANGO 直接预测 29-DoF 关节空间动作,使手臂、躯干和步态可协调适应障碍物。消融实验(论文中提及)进一步表明,移除仿真数据生成中的 障碍物感知运动编辑 或 RL 跟踪 环节会降低穿越成功率。该设计对实际工程的启示是:对于高维人形机器人,端到端学习 + 仿真合成监督 可有效减少模块间信息损失,但仿真数据的多样性和物理合理性仍是零样本迁移的关键。

行业影响

落地场景

TANGO 直接输出 29-DoF 关节空间动作,适合部署在 人形机器人 上,用于 室内杂乱环境导航。典型场景包括:电商仓储 中的人形拣选机器人、医院/养老 中的物资递送与陪护、商业楼宇 巡检与引导、家庭服务 等。这些场景的共同点是空间狭窄、障碍物动态变化,需要全身避障而非仅 2D 路径规划。

商业价值

  • 降低部署成本:零样本 sim-to-real 部署无需采集真实导航数据,减少现场调试与人工标注。
  • 提升任务成功率:全身避障可处理移动底盘无法通过的窄缝、低矮空间,扩大机器人可达范围。
  • 加速产品迭代:仿真数据生成管线支持快速扩充环境多样性,缩短从指令设计到功能验证的周期。

与现有工作流的接口

TANGO 可作为 高层语言导航控制器,通过 ROS2 topic 订阅 RGB 图像并发布关节位置/速度指令,替代传统 “SLAM+全局规划+局部控制” 的模块化栈。建议与 运动重定向、全身阻抗控制 等模块结合,确保安全性。仿真数据生成部分可复用现有的 Isaac Sim / MuJoCo 框架。

具体 use case

  1. 电商仓储人形拣选:工人说 “去 A 区第三排货架取包裹”,TANGO 控制 G1 在货架间侧身通过,手臂避开突出物,完成自主导航。
  2. 医院夜间物资配送:护士通过语音指令让人形机器人从药房送到病房,经过走廊中的轮椅、推车等障碍,TANGO 实时调整躯干和步态。

局限

  • **训练数据完全来自仿真合成**,虽然 TANGO 在真实世界 zero-shot 展示了一定鲁棒性,但 sim-to-real gap 仍不可忽视。具体包括视觉域差异、传感器噪声、接触摩擦与柔顺性差异等,这些因素可能导致策略在未见过的真实环境中性能下降。 此外,训练场景多为静态杂波环境,缺少对移动障碍物或动态人群的交互学习,因此对动态场景的适应性有待验证。与基于真实数据微调的方法相比,纯仿真策略在真实部署时需要更强的域随机化和鲁棒性设计。
  • **教师轨迹依赖全局路径规划与离线运动编辑**,学习到的策略可能过度拟合全局最优路径,难以进行有效的局部重规划。当环境发生临时阻断或路径不可行时,模型缺乏在线调整的机制,可能陷入局部困境。 另外,语言指令的理解目前局限于简单导航目标描述,对包含空间关系模糊、多步组合或否定条件的复杂自然语言指令支持有限,限制了其在实际人机交互场景中的应用范围。
  • **直接预测 29-DoF 关节空间动作**,虽然简化了下游控制,但未显式建模全身接触动力学与摩擦约束。在需要身体部位与障碍物发生安全接触(如侧身挤压穿过极窄空间)的任务中,仅依赖无接触的运动学监督可能失效;且实验尚未系统评估连续接触规划能力。 此外,当前工作主要聚焦于静态环境下的导航,对于非结构化场景中的临时障碍物处置、地面不平整或负载变化等实际因素考虑不足。
论文Anqi Li2026-09-08原文

相关内容