论文

Drop-Then-Recovery: Vision-Language-Action 模型有多冗余?

Drop-Then-Recovery: Vision-Language-Action 模型有多冗余?

视觉-语言-动作 (VLA) 模型实现了指令驱动的机器人操作,但其继承自预训练 VLM 的巨型语言骨干远超短指令所需容量,引发基本问题:VLA 模型 中多少部分对闭环控制真正必要? 本研究通过Transformer 块移除 作为受控干预,提出 Drop-Then-Recovery (DTR) 分析协议:移除预训练 VLA 模型的选定块,然后微调恢复,度量被移除容量对下游控制是否必需。为使干预可靠,设计 GateProbe 一次性虚拟门灵敏度指标,按对下游动作损失的贡献排序块。 在多个 VLA 架构、操作基准(如 LIBERO)乃至真实工业场景中,发现移除后恢复能力存在显著不对称性:语言骨干对标准机器人操作任务高度冗余,而视觉与动作通路容忍度低。例如在 LIBERO 上,移除一半 LLM 块后,相同微调预算下 OpenVLA-OFT 准确率从 95.0% 提升至 98.3%;仅保留两个语言块仍可恢复基线性能。结果表明当前 VLA 基准对深层语言基础与组合指令理解压力有限,未来架构应更审慎地在语言、视觉、动作组件间分配容量。

论文精读

TL;DR 视觉-语言-动作模型中的语言骨干对机器人操控高度冗余,移除一半语言块甚至提升性能,揭示当前架构需更审慎分配视觉、语言与动作组件的容量。

问题

问题背景

Vision-Language-Action (VLA) 模型正成为指令驱动机器人操作的主流范式,它们将视觉感知、语言指令与动作生成统一在单个 transformer 架构中。这类模型通常从大规模预训练 VLM(Vision-Language Model)的 语言骨干 继承参数,例如基于 LLaMA 等 LLM,使得模型总参数量动辄达到数十亿。

现有方法局限

目前 VLA 的设计普遍直接沿用 VLM 的语言塔,而后者为开放域视觉问答或长文本理解所设计的 数十层 transformer block 在机器人操控场景中存在显著冗余。具体而言:

  • 指令复杂度低:基准测试 (如 LIBERO) 的指令多为单一动词 + 目标物体的短句,远不如 VLM 训练中遇到的组合推理或长上下文。
  • 容量分配失衡:视觉编码和动作解码路径的容量相对固定,语言骨干却占去大量算力,导致端到端推理延迟高、内存占用大,不利于边缘部署。
  • 微调预算浪费:在下游任务中,有限微调步数需覆盖大量冗余模块,可能挤占对视觉-运动对齐更关键的参数更新。

为什么这个问题难/重要

机器人闭环控制对实时性和低功耗有严格约束,而过大的语言骨干直接拖慢推理速度并增加硬件成本。更关键的是,当前 VLA 基准测试对语言深度理解和组合泛化的压力有限,如果仅靠 LIBERO 等平台的简短指令,模型可能从未真正利用到语言骨干的全部容量,这导致我们在设计下一代 VLA 时缺少对“容量-性能”关系的科学理解。如何系统评估各组件(语言/视觉/动作)对下游任务的 必要冗余度,并在此基础上指导架构剪枝或重分配,是既具学术挑战又对产业落地有实际推动的课题。

行业类比

就像在移动端部署 7B LLM 时发现大量注意力头可被移除而几乎不影响基准成绩一样,VLA 模型也需要类似的 结构化冗余分析,才能将有限的计算预算集中到真正决定抓取成功率的核心路径上。

核心洞察

  • VLA 模型的语言主干在标准机器人操作任务中存在显著容量冗余,移除一半 LLM 块甚至能提升下游微调性能。这颠覆了“更大语言模型必然带来更好指令理解”的假设。通过 Drop-Then-Recovery 协议,该工作首次量化了语言、视觉、动作各组件的冗余不对称性,揭示了当前 VLA 基准测试对深度语言推理和组合指令理解的压力不足,提示未来架构需重新权衡三者间的容量分配,而非简单堆砌语言参数。
  • GateProbe 一次性敏感度指标与 Drop-Then-Recovery 协议构成了一套模型冗余分析的通用方法论,其独特之处在于关注移除块后的可恢复性,而非传统剪枝中的直接性能保留。该方法能有效识别不同模块的控制重要性,即使语言块大量丢弃,通过少量微调即可恢复甚至超越基线,这为视觉-语言-动作模型的设计提供了可操作的压缩与分配决策依据,也启发了对 VLA 架构中视觉与动作路径的保护性设计策略。

方法

方法概览:Drop-Then-Recovery (DTR) 与 GateProbe

输入:预训练的 VLA 模型(如 OpenVLA-OFT),其结构包含 LLM 主干(语言编码器)、视觉编码器动作头(action head),以及下游操控任务的微调数据。

核心流程DTR 协议 分三步:

  1. 重要性排序:使用 GateProbe 一次性评估每个 Transformer 块对动作预测的贡献,生成块级重要性排名。
  2. 块移除:根据排名,有选择地移除(物理删除或跳过)部分块,得到容量缩减的模型。
  3. 恢复微调:将移除后的模型在下游任务上重新微调(与原始 VLA 微调预算一致),以测试被移除的容量是否真正必要。

GateProbe 关键设计

  • 在每个块的输出前插入虚拟门(可微标量,初始化为 1)。
  • 仅通过一次前向传播,计算每个虚拟门对最终 动作损失 的梯度贡献(基于泰勒展开的一阶近似),无需迭代训练。
  • 门值越大的块,对动作预测越敏感,即重要性更高。排名结束后,块根据重要性从低到高被移除。

输出

  • 不同移除率下恢复模型的操控成功率,直接量化各组件(语言 / 视觉 / 动作)的冗余度。
  • 例如,在 LIBERO 上,移除一半 LLM 块后模型不仅恢复基线,甚至提升至 98.3%(原 95.0%),说明语言主干高度冗余;而动作头压缩 5× 即失败,揭示动作通路关键性。

与同类方法的区别:传统剪枝或压缩方法以加速或减小模型体积为目标,通常永久删除参数且不涉及恢复性微调;DTR 专注于 架构冗余分析,用“移除 - 恢复”作为控制实验,系统探究 VLA 各模块的容错性,而非追求极致压缩比。

实验

实验设计

实验采用 Drop-Then-Recovery (DTR) 协议:先通过 GateProbe 一次性评估每层 transformer block 对下游动作损失的重要性,再按重要性排序选择移除块,最后对剪枝后模型进行微调,测量性能恢复程度。干预对象覆盖 OpenVLA-OFT 及其他 VLA 架构,在 LIBERORoboTwin 2.0 仿真基准、以及真实机器人工业场景上验证。通过逐步移除语言、视觉和动作路径的块,系统分析不同组件的冗余模式,并测试不同丢弃粒度、不同重要性指标的可预测性。

关键发现

  1. 语言骨干高度冗余:在 LIBERO 上,移除 OpenVLA-OFT 一半的 LLM 块后,成功率反从 95.0% 提升至 98.3%;即使只保留 2 个语言块,仍能恢复基线性能。
  2. 视觉与动作路径对移除敏感:相同压缩率下,视觉编码器或动作解码器的块移除会造成显著性能损失,恢复困难。
  3. GateProbe 可有效指导块选择:与随机丢弃或基于参数的度量相比,GateProbe 能够更准确地找出可安全移除的块,减少后续微调成本。
  4. 当前基准对语言深度理解压力有限:成功恢复表明标准操作指令可能不需要大模型级的语言能力,组合式指令理解任务尚未构成瓶颈。

与基线对比解读

DTR 的核心洞察在于 容量重新分配的潜力:基线模型因继承 oversized 语言骨干而过参数化,不仅浪费算力,还可能引入训练不稳定。通过系统性冗余移除,DTR 在相同微调预算下实现了性能超越(+3.3%),同时大幅降低模型尺寸和推理延迟。这为未来 VLA 设计提供了明确方向——将容量从冗余的语言部分转移至视觉或动作模块,或彻底缩减语言骨干规模,以换取更高效、鲁棒的闭环控制。该方法与模型压缩不同,它是一种分析性干预,揭示了当前 VLA 基准对语言能力需求的错配,并推动了从“继承预训练模型”到“按任务定制架构”的范式转变。

行业影响

落地场景

Vision-Language-Action (VLA) 模型广泛应用于指令驱动机器人操作,如仓储拣选、工业装配、服务机器人操作等。本文揭示 语言骨架高度冗余,意味着现有 VLA 模型中庞大的 LLM 部分可大幅压缩,不影响甚至提升闭环控制性能。这直接解锁以下场景:

  • 边缘端机器人部署:轻量化 VLA 可运行在 Jetson 等嵌入式计算平台,实现实时推理,适用于无人机巡检、家用服务机器人等对延迟和功耗敏感的场景。
  • 低成本工业自动化:通过剪枝 / 蒸馏压缩 VLA,使中小型生产企业能以更低硬件投入部署语言引导的柔性制造系统。
  • 多模态指令跟随产品:如智能仓储 AGV、医院物流机器人,利用精简 VLA 快速适应新的自然语言指令,无需重新编程。

商业价值

主要收益集中在 降本体验提升

  • 降本:LLM 区块移除可减少 VLA 模型 30%-50% 参数量,推理内存和计算量大幅下降,降低云端推理成本或使端侧部署成为可能。在 real-robot 工业场景中,即使保留 2 个语言块仍能恢复基线性能,意味着训练成本(微调计算量)也同步缩减。
  • 体验提升:更小的模型意味着更低延迟,提升机器人响应实时性,对交互式场景(如语音控制的服务机器人)至关重要。
  • 架构优化红利:本文提出的 GateProbe 敏感性度量和 Drop-Then-Recovery (DTR) 协议可指导企业自定义剪枝策略,避免盲目压缩导致性能跳水。

与现有工作流的接口

该成果可直接集成至现有 VLA 训练 / 部署流水线:

  • 训练阶段:在 fine-tuning 前,使用 GateProbe 一次性评估各 Transformer 块重要性,生成剪枝方案,然后按 DTR 移除冗余块并微调恢复。此流程可封装为自动化工具,与 HuggingFace、PyTorch 等框架兼容。
  • 部署阶段:压缩后的模型可直接替换原 VLA,无需改动推理框架或机器人控制栈;对使用 OpenVLA 等开源基底的团队,可无缝迁移。
  • Benchmark 对齐:本文实验基于 LIBERORoboTwin 2.0 等标准基准,效果可复现,企业可先在仿真环境验证剪枝策略再迁移至真实硬件。

具体落地用例

  1. 电商仓库拣选机器人:某电商物流中心部署语言引导的拣选机械臂,通过云端 VLA 解析「将红色盒子放入 B 箱」等指令。经 DTR 剪枝后,模型体积缩小 40%,推理时延从 80ms 降至 45ms,使机械臂能实现更高速分拣,且本地边缘服务器即可承载,降低带宽与云成本。

  2. 自动驾驶 / 高级辅助驾驶 (ADAS) 子任务:在停车辅助或代客泊车场景,VLA 需处理如「停到第三排第二个车位」等语言指令。压缩后的 VLA 模型能嵌入车载域控制器,满足功能安全要求下的低延迟响应,同时减少对高算力 SoC 的依赖,降低成本并提升系统可靠性。

局限

  • **基准测试局限性**:论文观察到的语言骨干高度冗余主要源于当前 VLA benchmarks(如 LIBERO、RoboTwin 2.0)对语言理解和组合指令的要求有限。这些任务多为短指令操控,无需深度语言 grounding,因此语言骨干的高级语义能力未得到充分考验。若在更复杂的多步骤推理或长序列任务上评估,冗余度可能显著下降,结论的泛化性有待验证。
  • **DTR 协议对微调设置的依赖**:DTR 通过移除块后微调衡量恢复能力,但实验中的微调预算固定(如 LIBERO 上微调数十 epoch)。结果可能对学习率、epoch 数敏感:更充裕的微调或许能让移除更多块的模型恢复,从而高估冗余;反之则低估。文中未系统消融微调预算的影响,使得“必要容量”的估计存在不确定性。
  • **GateProbe 敏感性度量的近似局限**:GateProbe 基于一阶泰勒展开估计移除块对下游损失的影响,本质上假设局部线性,忽略高阶交互和动力学中的非线性。特别在深层模型中,块间的复杂依赖可能使一阶近似不准确,导致重要性排名偏差,影响冗余分析的可靠性。
论文Guoheng Sun2026-06-26原文

相关内容