ReferTrack: 先指示后跟踪的具身视觉跟踪
具身视觉跟踪 (EVT) 要求移动智能体仅使用机载视觉持续跟踪自然语言描述的特定目标。现有视觉-语言-动作 (VLA) 策略通过链式推理统一目标识别和轨迹规划,但其推理常基于抽象空间潜变量,难以监督且与显式图像检测对齐弱。 为解决此问题,本文提出 ReferTrack,一种先指示后跟踪的范式。模型首先从索引的边界框集合中选出目标,然后基于图像决策解码跟踪路点。通过滑动窗口队列保存历史选中边界框,注入 时间-视角-边界框指示器 (TVBI) 令牌以保留目标运动线索。此外,在自建 Refer-QA 数据集上协同训练以增强目标识别。 在 EVT-Bench 上,单摄像头设置下,ReferTrack 在单目标、干扰和歧义跟踪场景中分别达到 89.4%、73.3% 和 74.1% 的成功率,在识别密集型任务上匹配甚至超越多摄像头基线。在四足和人形机器人上的真实部署验证了其稳健的 sim-to-real 迁移能力。代码已开源。
论文精读
TL;DR ReferTrack 提出“先指认后跟踪”范式:用单目相机先从候选框中选出语言描述的目标,再据此规划跟踪轨迹,通过滑动窗口注入历史框几何特征,在 EVT-Bench 上以单视角超越多相机方案,并成功迁移至真实机器人。
问题
问题背景
具身视觉跟踪 (Embodied Visual Tracking, EVT) 要求移动机器人仅凭单目视觉和自然语言指令,在动态场景中持续跟随特定目标。随着具身智能发展,如何高效耦合目标识别与运动规划成为该领域焦点。
现有方法局限
主流方法采用 视觉-语言-行动 (VLA) 策略,将识别与规划统一为端到端的序列预测,并借助思维链 (Chain-of-Thought) 在隐空间进行推理。然而,这种设计存在两个关键问题:
- 空间特征难以监督:CoT 推理过程潜藏于抽象高维向量,缺乏显式的图像空间约束,导致模型难以精准对齐目标区域。
- 检测与规划弱耦合:隐式决策无法回溯目标边界框,当场景干扰物增多或目标外观变化时,行动规划易出现漂移或误跟随。
这使得模型在干扰追踪 (distracted tracking) 和歧义追踪 (ambiguity tracking) 场景下鲁棒性不足,且单视角方案常大幅落后于多相机系统。
技术挑战与重要性
EVT 的核心难点在于:机器人需在连续帧中辨别符合语言描述的唯一目标,即使周围行人高度相似;同时规划路径需兼顾目标运动预测、障碍规避和跟踪距离维持。隐式 VLA 策略缺乏可解释的中间表征,使错误传播难以诊断,且端到端训练需要大量高质量跟踪数据。业界正寻求可解释、易部署的单目跟踪方案,以降低对昂贵多传感器系统的依赖,推动机器人走向真实世界。
类比:类似自动驾驶中根据“跟住前面那辆蓝色货车”的语音指令持续导航,但 EVT 更强调移动本体与目标的动态交互与实时重识别。
核心洞察
- - **解耦“指代”与“跟踪”实现可监督的图像空间锚定**。ReferTrack 将 EVT 分解为两个阶段:先从索引候选框中选择目标,再基于该图像级决策解码跟踪航路点。这与当前 VLA 类方法(如基于 CoT 的隐空间推理)形成鲜明对比——后者难以直接监督空间定位,弱对齐于显式的目标检测。这种“先指后跟”的范式使决策黑箱变得可解释、可优化,并且对复杂环境中的目标识别错误更具鲁棒性。
- - **通过几何历史队列注入时序运动特征**。模型维护一个滑动窗口的历史选中框,并设计 TVBI (temporal-viewpoint-bbox indicator) token 将其几何特征注入视觉历史。相比仅依赖隐式记忆或丢弃过去帧信息的方法,该机制显式编码了目标随时间变化的运动模式,缓解了遮挡和视角变化导致的跟踪漂移,尤其在拥挤干扰场景下显著提升稳定性。
方法
ReferTrack 采用「先指代、再跟踪」的两阶段范式,将具身视觉跟踪解耦为目标识别与轨迹规划。
输入与特征提取
系统接收连续的单目前向 RGB 图像和一条自然语言指令(如“跟着穿红衣服的人”)。每帧图像通过目标检测器生成一组带索引的候选边界框,同时通过视觉编码器提取空间特征。语言指令经过文本编码器获得语义表征。
目标指代模块
该模块将文本语义与每个候选框的视觉特征进行跨模态匹配,从索引集中显式选择一个目标的边界框作为跟踪对象。这一“硬 grounding”决策将抽象的语言指代落实为图像空间的确定性输出,为后续规划提供可监督的中间表征。为提高指代鲁棒性,模型在Refer-QA 数据集上联合训练,增强对歧义描述(如人物属性相近)的分辨能力。
时序运动线索注入
为保留目标的运动信息,ReferTrack 维护一个滑动窗口队列,存储过去若干帧的选定边界框几何特征(如中心坐标、尺寸)。这些特征通过**时-视点-边界框指示符(TVBI tokens)**注入视觉历史中——TVBI tokens 作为可学习的位置嵌入,与视觉特征相加或拼接,使模型能动态感知目标的轨迹趋势,避免因遮挡或相似对象导致的身份漂移。
跟踪航点解码
基于当前帧的目标框和 TVBI 增强的历史特征,航点解码器预测机器人的跟踪动作——通常输出相对位移或下一航点坐标,引导机器人保持合适的跟随距离。解码过程不依赖隐空间推理,而是直接由图像级检测结果驱动,有利于 sim-to-real 迁移。
输出
模型最终输出连续的跟踪航点序列,可直接用于底层运动控制器,实现端到端的“说跟就跟”。
差异点:与近期基于 VLA 的隐式链式推理方法不同,ReferTrack 将指代显式 grounding 到检测框,避免了抽象隐空间监督困难的问题,在目标识别密集的任务上表现更优,且更容易部署到真实机器人平台。
实验
实验设计
ReferTrack 在 EVT-Bench 的三个标准分割上评估:单目标 (single-target)、干扰 (distracted)、歧义 (ambiguity tracking),涵盖 100+ 室内外动态场景。模型仅使用前视单目相机输入,与基于多摄像头的基线进行对比。训练阶段联合使用专家示范轨迹与自定义的 Refer-QA 数据集,以增强语言指代与视觉检测的对齐。评估指标为任务成功率,即 agent 全程正确锁定并跟随指定目标的百分比。
关键发现
- 单视角 SOTA:ReferTrack 在三个分割上分别达到 89.4%、73.3% 和 74.1%,显著优于现有单目视觉-语言-动作策略。
- 识别能力突出:在大量需要准确目标辨识的干扰与歧义场景中,性能匹配甚至超越多摄像头基线,证明显式边界框选择机制 (referring-then-tracking) 有效缓解了隐式空间推理的不可监督问题。
- 时序一致性支撑:滑动窗口队列与 TVBI token 注入历史边界框几何特征,使跟踪在目标遮挡或短期丢失后能快速恢复,消融实验证实该设计对成功率贡献显著 (+5~10%)。
- 真实世界泛化:在四足及人形机器人上零样本部署,验证了 sim-to-real 迁移鲁棒性。
基线对比解读
与主流的 VLA (vision-language-action) 端到端策略不同,ReferTrack 将任务分解为指代与跟踪两步,其推理过程可解释且易于监督。对比实验中,统一式 CoT 方法在干扰分集上成功率不足 60%,而 ReferTrack 超过 73%,核心差异在于将空间推理锚定到显式图像空间检测,消除了抽象潜在变量中的歧义。此外,仅凭单目视觉即可比肩多摄像头系统,为低成本机器人的 embodied 任务提供了新思路。
行业影响
落地场景
ReferTrack 提出的“先指后跟”范式为具身视觉跟踪(EVT)提供了单目低成本的解决方案,可直接应用于移动机器人、人形机器人、自动驾驶及智能监控等领域。典型场景包括:
- 服务机器人:在商场、医院或家庭中根据自然语言指令跟随特定人员(如“跟着那个穿红色夹克的人”),提升人机交互的自然度。
- 自主移动机器人(AMR):在仓库中跟随工人完成协作搬运,无需预设路径或信标。
- 自动驾驶:城区场景下根据乘客或交警的手势/语言指令跟随特定参考目标(如前车),增强对语意导航的支持。
商业价值
ReferTrack 通过单一前向摄像头实现目标识别与轨迹规划的统一,显著降低硬件成本(无需多传感器融合或高精度定位),并提升在人群密集场景下的鲁棒性。
- 降本:省去激光雷达或额外的深度传感器,使轻型机器人量产成为可能。
- 增收:增强机器人产品的语意跟随能力,可成为差异化卖点,助力开拓新市场(如老年看护、展馆导游)。
- 体验提升:单语言指令即可动态切换跟随目标,减少遥控或界面操作的摩擦,尤其适用于非专业用户。
与现有产品/工作流的集成
ReferTrack 可作为视觉语言动作(VLA)策略中的感知-决策模块,与现有机器人软件栈松耦合集成:
- 输入接口:接收 RGB 图像流和自然语言指令,输出目标边界框索引及相对位姿的航路点。
- 与 ROS 集成:航路点可无缝转换为 ROS 的
Twist或Path消息,供底层运动控制器消费。 - 与 VLA 框架互补:将 ReferTrack 作为“快速视觉定位”模块,把图像空间检测器与高层规划解耦,避免 VLA 模型在抽象空间推理中丢失空间精度。
具体用例:
- 仓储物流:移动机器人与工人协作拣货,通过语音指令“跟着推车走”即能动态跟随,无需人工编程跟随目标。
- 智能安防:安保机器人根据指令“跟踪那个背着双肩包的人”进行持续监控,减少安保人员直接接触风险。
项目代码已开源(GitHub),便于工业界直接评测与适配。
局限
- 依赖前置目标检测器:ReferTrack 需要从预检测的候选边界框集合中选择目标,若检测器漏检或误检,会直接影响跟踪。论文未讨论检测器失败时的鲁棒性策略,且未与检测器联合优化,在实际部署中可能成为瓶颈。
- 单帧决策的时序局限:虽然使用滑动窗口注入历史边框特征,但每次决策仍基于当前帧选择并规划,对于目标被短暂完全遮挡或快速机动可能跟踪漂移,历史信息可能不足以恢复。实验未在极端扰动场景评估。
- 数据集和场景多样性有限:评估主要在 EVT-Bench 的三个子集上,且真实实验仅展示了受控环境;未在更多样化室内外环境、不同光照/天气或人群密度下验证,泛化能力待进一步考察。此外,Refer-QA 数据集为自动生成,可能引入偏置,影响实际开放词汇理解。