检索,不重训:测试时扩展 Vision Language Action 模型至新任务
将视觉-语言-动作(VLA)策略扩展到新任务通常需要特定任务的遥操作演示和每任务微调,导致数据收集和计算成本高昂。本文证明,这种目标侧每任务适应成本可以通过检索替代。 我们的检索增强策略仅需在目标本体的配对演示(查询侧)和一个更低成本的本体(池侧,例如人类手部视频)上训练一次,然后冻结。部署时,新任务通过将池侧演示添加至检索池来加入。冻结策略在每个控制步条件化于检索到的轨迹,因此新任务通过索引数据而非更新参数来吸收。仅当面对新的未见本体时才需要微调,而非每个新任务。 实验表明,检索提升了多种骨干策略(包括标准VLA策略)的性能,其效果在Cosmos Policy(基于视频生成的世界-动作模型)中尤为显著。在该设定下,检索提供粗粒度的任务进展,而WAM的未来图像目标提供额外的视觉一致性信号,强化检索条件化动作。在PushT上,我们研究了检索如何提供可重用的高层运动先验,用于跨本体泛化至未见目标角度;在RoboTwin 2.0上,我们的方法在未见任务上优于跨本体基线,并在真实机器人上进行了演示。
论文精读
TL;DR 用检索替代每任务微调,冻结的视觉-语言-动作策略通过动态索引演示池适应新任务,实现跨任务零样本泛化,仅需在新实施方式上微调。
问题
问题背景
视觉-语言-动作(VLA)模型正在成为机器人操控的核心范式,但使其泛化到新任务仍依赖大量任务特定的遥操作演示与微调,阻碍了快速部署。
现有方法局限
当前扩展 VLA 策略到新任务的典型流程是:针对每个新任务收集遥操作演示,然后在目标具身(例如真实机器人)上逐任务微调参数。这带来三重瓶颈:
- 数据成本高:遥操作需要人工介入,每个新任务都需要独立采集;
- 计算开销大:每增加一个任务即触发一次全模型微调,无法高效复用已有知识;
- 池端数据浪费:大量更易获取的廉价具身数据(如人手视频)仅被用作预训练源,无法在推理时直接参与任务定义。
为什么这个问题难/重要
技术挑战在于:如何让一个冻结的策略模型在看到新任务时,仅通过扩充外部数据池就获得相应的行为先验,而无需修改权重?这要求模型能够动态地从异构、未对齐的池端轨迹中提取与当前观测相关的运动模式,并将其转化为可执行动作。
业界关注度源于:若按需微调被检索替代,则机器人系统可像大语言模型接入 RAG 一样,将新任务刻画为新增的索引数据,大幅降低扩展成本,并提升对跨具身(cross-embodiment)设定的适应效率——这正是通用机器人从实验室走向规模化部署的关键路径之一。
行业类比
类似检索增强生成(RAG) 让大语言模型无需微调即可利用外部知识库回答新问题,本文方法让 VLA 策略通过检索池端轨迹来执行新任务,避免重复训练。
核心洞察
- **检索代替参数更新**:传统视觉语言动作(VLA)模型每新增一个任务都需要采集特定演示并微调全部参数,成本高昂。本工作冻结策略网络,将适应机制外化为一个可动态扩展的检索池,新任务只需追加池侧演示,无需任何训练。这与当前主流的每任务微调范式形成鲜明对比,将持续部署的计算与数据开销从 O(任务数) 压缩到 O(1),为机器人终身学习提供了更轻量的基础。
- **视频生成与检索的互补**:在 Cosmos Policy 中,检索提供粗粒度的任务级运动先验,而视频生成模型的未来图像预测目标则施加细粒度的视觉一致性约束,两者协同使得动作预测更鲁棒。相比于纯检索方法容易受视觉歧义影响,或纯生成模型缺乏长期规划参考,这种结合利用了检索的高层语义和生成的低层视觉对齐,显著提升了跨任务与跨具身的泛化能力。
方法
输入与训练设定
训练数据为成对演示(paired demonstrations):目标机器人操作轨迹(query)与更易获取的参考演示(池,如人类手部视频)。策略网络仅训练一次,之后参数冻结。
检索增强的动作预测框架
在每个控制步,给定当前观察,从池中检索最相似的轨迹片段。检索采用两阶段策略:先基于初始场景匹配候选轨迹,再在子帧级别精细检索。检索到的轨迹作为条件输入送入策略网络,引导动作生成。
世界动作模型中的协同作用
当基础模型为Cosmos Policy(视频生成式世界动作模型)时,检索提供粗粒度的任务进展信息,而模型的未来图像预测目标则强化了动作与视觉一致性的约束,两者互补以提升检索条件下的动作质量。
无需重训的新任务扩展
部署时,仅需将新任务的池侧演示追加至检索池,策略就能通过索引数据吸收新任务,免去了传统 VLA 每任务收集遥操作演示和微调的昂贵开销。只有当机器人本体发生变化(如从单臂变为双手)时,才需对策略做适配性微调。
差异点:与传统 VLA 策略针对每个新任务需求大量遥操作数据和模型重训不同,本方法将任务适应转变为纯数据检索问题,通过冻结的策略和动态扩展的检索池,大幅降低了数据采集和计算成本,同时利用世界动作模型的未来预测提升跨体现泛化能力。
实验
实验设计
论文在三个场景验证检索增强策略:PushT 模拟器、RoboTwin 2.0 双足机器人仿真,以及一个真实机器人。训练时,策略在目标形态(如机械臂)与低成本形态(如人手视频)的配对演示上训练一次即冻结;部署时,新任务仅需向检索池添加池侧演示,无需微调。
关键发现
- 冻结策略在每一步控制时动态检索相关轨迹,新任务通过索引数据而非更新参数被吸收。
- 检索对多种骨干模型均有提升,但在 Cosmos Policy(基于视频生成的世界行动模型)上效果尤为突出:检索提供粗粒度任务进度,未来图像目标贡献视觉一致性,进一步强化动作预测。
- 在 PushT 上,检索提供了跨形态泛化至未见目标角度的高层运动先验;在 RoboTwin 2.0 上,方法在未见任务中超越跨形态基线。
与基线对比
相比需要逐任务收集遥操作演示并微调的标准 VLA 策略,检索方法将适应成本降为零,仅需一次配对演示训练,新形态适应也只需微调一次而非每个任务。与普通 WAM 相比,Cosmos Policy 结合检索后,粗粒度引导与细粒度视觉一致性形成互补,大幅提升跨任务泛化效率。
行业影响
落地场景
该检索增强范式可直接用于具身智能产品,如仓储物流机器人、家用服务机器人、协作机械臂等。当需要快速适应新任务(如拾取新物体、完成未见的组装步骤)时,不必重新收集遥操作演示和微调模型。仅需将少量“池端”演示(例如人手演示视频)加入检索数据库,冻结的视觉-语言-动作(VLA)策略即可在推理时通过检索相似轨迹,零样本执行新任务,尤其适合任务需求频繁变化、无法停机更新模型的生产线或家庭环境。
商业价值
核心价值是降低总拥有成本并加速部署周期。传统方法每新增一个任务需高成本的遥操作数据采集(通常数千美元/任务)和数小时至数天的 GPU 微调。此方案将成本缩减为只需少量廉价池端示范,模型参数固定,无需再训练。这直接转化为机器人产品 SKU 扩展速度的提升和客户现场更新的可行性,提高客户留存率与市场响应速度,对机器人即服务(RaaS)模式可显著降低边际服务成本。
与现有产品/工作流的接口
集成进现有机器人软件栈极为轻量。只需在已训练的 VLA 模型(如 RT-2、Octo)旁挂载一个基于 CLIP 特征的向量检索索引,在动作预测前插入检索步骤。现有的大量遥操作演示库可直接转换为检索池,并可随业务增长渐进式扩展。该方案兼容机器人操作系统(ROS),检索模块可作为独立节点,通过网络 API 与模型推理服务互通,无需替换现有模型结构。
具体落地 use case
- 电商仓储动态拣选:在履约中心 SKU 频繁变动,传统模型需不断收集新物体抓取演示并重训。采用本方法,可预先建立大量人手拾取物体的示范库,新商品入库时仅添加少量人手示范到检索池,无需改动抓取模型,即可泛化到新物体。
- 辅助医疗康复机器人:面对不同患者的个性化训练任务,治疗师通过演示特定动作(如手臂引导),检索增强模型可即时适应,无需为每位患者重新训练,大幅减少部署成本与等待时间。
局限
- **检索池覆盖与质量依赖**:新任务的适应完全依赖检索池中已有的相关演示,若池内缺乏与目标任务轨迹足够接近的样本,检索到的条件信号将无法提供有效引导,任务性能会显著下降。虽然池侧演示(如人手视频)比遥操作采集廉价,但仍需预先积累一定规模的多样本数据,这限制了在完全陌生任务上的即插即用能力。
- **新体现仍需微调**:方法仅消除了**每任务微调**,但当目标硬件平台(embodiment)与训练时不同时,仍需进行一次**体现级微调**。实验中的体现变化限于 PushT 目标角度和 RoboTwin 的构型微调,对形态差异大的机器人(如不同自由度的机械臂)是否只需少量微调尚不明确,泛化到全新形态可能仍需大量适配工作。
- **推理延迟与计算开销**:每控制步需执行检索和 **Cosmos Policy** 的未来帧生成,增加了在线推理的计算负载。论文未详细分析端到端延迟,对于需要高频控制的实时任务(如动态抓取),可能无法满足实时性要求,限制了在资源受限或强实时场景下的应用。