Domain Arithmetic:环境变化下的单样本VLA适配
Vision-Language-Action (VLA) 模型在环境变化(如相机姿态改变、迁移到不同但相似的机器人,例如从 Panda 到 UR5e)时,往往无法执行已学任务。传统方法需要对每个任务收集多个演示数据进行训练,成本高昂。 为减轻数据收集和训练负担,本文提出一种基于类比的方法 Domain ARiThmetic (DART),通过权重向量算术添加领域特定信息,实现环境变化下的 VLA 模型适配。与以往方法不同,DART 仅需单个演示即可完成高效适配。为准确提取领域特定信息,DART 对权重向量中的奇异分量进行子空间对齐,过滤噪声分量。 在仿真和真实实验中,DART 在单样本场景下(涵盖多种视觉和具身变化)优于现有 VLA 适配方法。代码已开源。
论文精读
TL;DR DART 通过权重向量算术与子空间对齐,仅需一次演示即可将 VLA 模型适配到新环境(如相机位姿或机器人本体变化),显著降低数据采集成本并优于现有单次适配方法。
问题
问题背景
机器人学习领域,Vision-Language-Action (VLA) 模型 通过大规模预训练已能完成复杂操作任务,但模型对视觉环境(如相机位姿)与机器人本体(如 Franka Panda → UR5e)的偏移极为敏感,同一任务在不同设定下性能骤降。
现有方法局限
现有域适应方案通常需要为目标域每个任务采集多条演示数据,并重新微调模型,这种数据与训练开销严重阻碍 VLA 的快速部署。 单样本微调(one-shot fine-tuning)虽减少数据需求,却普遍存在灾难性遗忘与域过拟合:模型要么忘记源域任务,要么无法泛化到目标域的新变化。 先前工作未有效分离任务特定信息与域特定信息,因此单一演示不能稳定成新的域适应方向。
为什么这个问题难且重要
核心挑战在于,VLA 权重空间中任务方向与域方向高度纠缠,少量目标域数据不足以可靠地抽取域偏移的表示,且随机初始化或简单算术组合往往引入噪声,破坏原有任务结构。 从工程落地看,机器人每次部署环境、摄像头、硬件损换等微小改变,若都需大量采集示范,将严重限制 VLA 在柔性制造、服务机器人等实际场景的推广。 业界急需一种样本高效、即插即用的适应方法,在不牺牲源域性能的前提下,只凭一个目标域演示实现可泛化的域迁移。
行业类比
类似大语言模型领域,通过权重算术(weight arithmetic)实现任务向量的组合与迁移,VLA 期望用同样的思路在物理机器人数据极度稀缺的条件下完成域适应,将模型编辑从“重训练”推进到“向量操作”的新阶段。
核心洞察
- **单次演示的 VLA 适应可通过权重算术将任务与领域信息解耦**。DART 的关键发现是:即使在环境偏移下,只需收集目标域的单条演示,并通过子空间对齐提取出泛化的领域方向向量,就能以加法组合的方式迁移到新域。这突破了以往域适应方法需要每个任务多个演示的限制,将数据需求降到每个新域仅需一次演示,显著降低了部署在真实物理机器人上的工程成本和试错风险。
- **子空间对齐过滤噪声,提升单次适应的可靠性**。直接使用单次微调的权重更新会混入任务特定噪声,导致跨域泛化失败。DART 通过 SVD 分解更新向量,并计算源域与目标域更新向量在奇异子空间中的对齐度,仅保留共享的领域方向,抑制噪声。这种基于频谱的过滤策略比简单插值或全量微调更稳定,确保了即使只有少量数据,适应过程也不会破坏原有任务能力,同时获得新域的泛化性。
方法
DART 方法的核心思想是通过权重向量算术,将从一个演示中提取的域特定信息注入预训练 VLA 模型,实现一次性环境迁移。
输入
- 预训练的 VLA 模型(如 OpenVLA、RT-1 等)以及其在源域(原始训练环境)上的模型权重。
- 源域下的一次任务演示和目标域(新环境,如相机位姿变化或不同机器人实体)下同一任务的一次演示。
关键模块与处理流程
获取一次性更新向量
分别在源域和目标域的单个演示上对预训练模型进行少量步数的微调(例如全参数微调或 LoRA),得到两个更新向量Δθ_src和Δθ_tgt。这些向量编码了任务知识与环境偏差的混合信息。域向量提取
通过取两个更新向量的差值Δθ_domain = Δθ_tgt - Δθ_src来消除任务成分,初步得到域特定信息。然而此向量仍包含大量噪声和干扰。子空间对齐增强域向量
- 子空间分解:对
Δθ_src和Δθ_tgt的每一层权重矩阵进行奇异值分解(SVD),提取主要奇异向量(即子空间基底)。 - 对齐过滤:计算两个子空间中对应奇异向量间的对齐程度(如余弦相似度),仅保留对齐度高于阈值的向量。这保留了与任务相关的稳定成分,滤除由于单次微调引入的噪声和随机分量。
- 子空间缩放:对保留的奇异值施加缩放系数
α,控制域信息注入的强度,防止过度破坏源模型的基础能力。 - 重构域向量:利用对齐过滤及缩放后的奇异值/向量重构权重矩阵,得到干净且强度可控的域特定向量
Δθ_domain_filtered。
- 子空间分解:对
加法组合
将过滤后的域向量直接加到源模型的原始权重上:θ_adapted = θ_src + Δθ_domain_filtered,得到适配目标域的模型参数。
输出
- 一个可以直接在目标域执行任务的 VLA 模型,无需额外训练或测试时自适应。
与同类方法的差异点:相较于需要多演示的域适配方法(如 Domain Randomization、few-shot fine-tuning),DART 仅需一次演示,且通过子空间对齐从单次更新向量中分离出域信息,有效避免过拟合,在仿真和真实实验中均展现更强的一次性迁移性能。
实验
实验设计
为验证 DART 在单次演示(one-shot)下的跨环境适应能力,论文在 模拟环境(LIBERO、MimicGen)和真实机器人平台上进行了系统评测。
- 视觉域迁移:模拟中构造不同的相机位姿、光照、背景等 shift,评估开抽屉、抓取等任务;
- 跨实体迁移:从 Franka Panda 到 UR5e 机器人,测试同一任务的泛化;
- 真实世界实验:在物理机器人上采集单个演示,直接部署适应后的策略。
所有实验均与多种 VLA 微调基准(如 RETAIN、FLA 等)对比,并涵盖消融研究(子空间对齐各组件、域向量合并数量、缩放系数等)。
关键发现
- DART 仅需单一目标域演示即可实现有效适应,成功率显著超越现有 one-shot 方法;
- 通过 更新向量 的子空间对齐,能精确提取域特定信息,抑制任务无关噪声,使权重算术组合更鲁棒;
- 在多种视觉 shift(相机角度、纹理、光照)和跨实体迁移中均取得稳定提升,展现了强泛化性。
基线对比解读
相较于需要多次演示的传统微调方案,DART 的 one-shot 效率优势明显;与同样采用权重算术的 RETAIN 等相比,DART 的核心差异在于引入 子空间滤波与缩放,避免了噪声成分污染域向量。实验表明,无子空间对齐的普通算术组合在跨域场景下容易失败,而 DART 通过仅保留对齐的主成分,成功实现了域信息的可靠加法。该思路对工程实践有直接启示:在资源受限的机器人部署中,用极少数样本快速构建域专属模型是可行且高效的。
行业影响
落地场景
DART 的核心能力是在环境变化(相机视角、光照、机器人本体变更)下,仅需一条演示即可使 VLA 模型适应新域,无需重新收集大量数据。该技术可嵌入以下产品:
- 仓储/制造机器人部署:当更换摄像头位置或升级机械臂型号(如从 Panda 切换到 UR5e)时,现场工程师只需采集一个任务示范,就能快速恢复操作精度。
- 家用服务机器人个性化:不同家庭环境、家具摆放导致视觉域偏移,用户仅需演示一次任务即可完成迁移,降低厂商上门适配成本。
- 具身智能开发平台:为机器人操作系统(Robot Operating System)或 VLA 模型服务提供 one-shot 适配插件,加速算法从实验室到实际场景的落地。
商业价值
- 降本:传统 VLA 适配需要每个任务数十条演示,DART 将数据需求降至单条演示,大幅节省采集标注人力与时间成本。同时,通过权重算术避免全参数微调,减少算力消耗。
- 增收:机器人方案商能以更低成本覆盖更多异构硬件与多变场景,缩短项目交付周期,提高投标竞争力。
- 体验提升:终端用户零等待即可在变化环境中复用已学技能,比如工业机械臂在照明改变后仍能稳定抓取,减少产线停机。
与现有产品/工作流的集成
DART 设计为轻量后处理方法,可与主流 VLA 框架(如 OpenVLA、RT 系列)无缝结合:
- 在源域用多任务演示训练 VLA 模型。
- 目标域采集单条演示,通过
DART计算域向量,经子空间对齐后与源模型权重相加,得到适应模型。 - 整个过程无需访问原始训练数据或重新训练,可封装为 模型更新微服务,通过 API 调用集成到 MLops 流程中。
具体落地用例
- 跨境电商仓库拣选:某物流机器人部署在多个国家仓库,因货架颜色、相机安装高度差异大,传统适配需重新标定与数据采集。使用 DART,本地操作员只需演示一次拣货动作,即可让原 VLA 模型适应本地环境,节省跨境部署成本。
- 工业缺陷检测与分拣:在自动化生产线,摄像头因震动导致视角偏移,已训练的抓取策略失效。DART 允许现场技术员采集一条纠正动作演示,瞬间修正模型,避免产线停摆,保障良率。
局限
- **源域演示依赖**:DART 的域向量提取要求存在源域上的成功演示,用于计算任务相关更新向量,从而分离域特定方向。当源域数据不可用(例如部署全新机器人时),方法可能无法直接应用,限制了其零样本迁移能力。作者虽讨论了源域演示的获取途径和鲁棒性,但实际仍增加了部署成本。
- **跨具身泛化边界有限**:实验涵盖的具身差异(Panda 到 UR5e)仍属于同一类机械臂构型,未涉及更剧烈的形态变化(如双手操作、移动底盘或灵巧手)。对于完全不同自由度和运动学的机器人,子空间对齐假设能否成立尚未验证。此外,视觉偏移主要为相机视角和背景变化,极端光照、遮挡或动态场景下的鲁棒性有待考察。
- **任务复杂度与多域合并的稳定性**:实验任务以桌面操作为主,单次演示可能不足以捕捉复杂长序列任务的域不变特征。在合并多个域向量时,尽管展示了叠加能力,但未系统分析向量冲突导致的性能退化边界。当需同时适应多个偏移(视觉+具身)时,缩放系数的选择缺乏自动化调参方案,工程化落地存在实操壁垒。