三思而后行:将树搜索蒸馏为冷冻 VLA 模型的动作评估
Vision-Language-Action (VLA) 模型 通过大规模预训练获得了广泛具身能力,但其泛化性远不如 LLMs 和 VLMs 稳健。当前主流方案——通过监督微调 (Supervised Fine-Tuning) 或强化学习 (Reinforcement Learning) 进行后训练——虽能提升特定任务性能,却削弱了预训练原有的通用能力。我们发现关键瓶颈:VLA 的失败不仅源于动作生成,也源于动作评估。一项诊断性 pass@k 研究表明,冷冻 VLA 的输出分布中已包含胜任的行为:pass@1 成功率为 33%,而 pass@32 升至 92%。 受此启发,我们提出 SVA (Search, Value, and Act) 框架,为冷冻 VLA 策略赋予长期后果感知能力。SVA 首先在仿真中使用蒙特卡洛树搜索 (Monte-Carlo Tree Search) 充分探索 VLA 输出分布,收集带有经验回报的多样化轨迹;然后将此知识蒸馏为一个轻量级 Q-value 模型,用于预测候选动作的预期后果;部署时,冷冻 VLA 生成多个候选动作,评估器选择具有最高不确定性正则化 Q-value 的动作,无需仿真器介入。通过解耦动作提议与后果评估,SVA 保留了 VLA 骨干的泛化能力,同时显著提升任务成功率。 在多个具身基准上的实验表明,SVA 持续改善未见任务的泛化,并展现出强测试时缩放 (test-time scaling) 行为。值得注意的是,SVA 使 9B 参数的 VLA 在推理延迟降低 27% 的情况下,性能超越 27B 参数 VLA 7 个百分点,说明缩放测试时评估比缩放模型尺寸更具性价比。
论文精读
TL;DR SVA 框架利用 MCTS 蒸馏出 Q 值评估器,让冻结 VLA 在推理时能够前瞻选择动作,使 9B 模型以更低延迟超越 27B 模型。
问题
问题背景
具身智能领域正致力于构建通用的 Vision-Language-Action (VLA) 模型,通过大规模预训练在多种任务上获得广泛能力。然而,VLA 的泛化能力仍远弱于 LLM 和 VLM,在实际部署中频繁失败。
现有方法局限
主流增强手段是对预训练 VLA 进行任务特定的后训练,如监督微调 (SFT) 或强化学习 (RL)。这些方法存在两个严重缺陷:
- 灾难性遗忘:微调会缩小模型的通用能力,破坏预训练积累的广泛行为先验,使模型退化为窄领域专家。
- 只优化动作生成:它们默认模型失败仅因为生成了错误动作,而忽略了动作评估(即无法从多个候选动作中选择正确的一个)这一关键瓶颈。
为什么这个问题难/重要
- 评估瓶颈被长期忽视:作者通过 pass@k 诊断实验 发现,冻结的 VLA 在 32 个采样动作中已有 92% 的成功率(而 pass@1 仅 33%),说明模型输出分布中本就包含正确行为,但缺乏有效的内部评估机制去识别它们。
- 成本与泛化的两难:增大模型规模(如从 9B 到 27B)虽能略微提升评估能力,但推理延迟和计算成本激增;而后训练又损害泛化。业界亟需一种既保留泛化能力,又能以低成本赋予 VLA 长期后果感知的方案。
- 部署约束:真实机器人无法在运行时访问模拟器,因此无法直接使用蒙特卡洛树搜索,必须将搜索知识蒸馏为可部署的轻量级评估器。
行业类比
类似大语言模型通过 奖励模型 (Reward Model) 从采样候选中选择最佳回复,而不是仅靠模型自身生成——将生成与评估解耦,能以更低成本获得显著性能提升。
核心洞察
- VLA 的瓶颈在于动作评估而非动作生成。通过 pass@k 诊断,frozen VLA 的 pass@1 仅 33%,但 pass@32 跃升至 92%,表明生成分布已包含高质量动作,只是缺少可靠的评估标准。现有方法通过微调或 RL 改善生成,却以牺牲预训练泛化能力为代价;SVA 另辟蹊径,引入轻量级 Q-value 模型来评估动作的长期后果,从而在冻结主干基础上大幅提升成功率,保留通用能力。
- 测试时缩放(test-time scaling)比模型缩放更经济有效。SVA 在推理时从一个冻结 VLA 采样多个候选动作,并通过不确定度正则化的 Q 值择优,无需仿真器。实验显示,9B 的 VLA 搭载 SVA 后性能超越 27B 的模型,且延迟减少 27%。这打破了“更强性能必须更大模型”的惯性思维,为实时具身系统提供了低计算成本、高泛化能力的部署范式,启示工业界在资源约束下可优先优化评估策略而非盲目扩充参数规模。
方法
输入与整体流程
SVA(Search, Value, Act)框架以冻住的 VLA 模型(不做任何参数更新)和任务仿真器为输入,输出一个能在测试时选择高质量动作的策略,全程无需仿真器介入。
关键模块:搜索、价值、行动
1. 搜索阶段:挖掘评估信号
利用蒙特卡洛树搜索(MCTS)在仿真中充分探索 VLA 的输出分布:
- 从当前状态开始,由 VLA 生成多个候选动作序列(轨迹)。
- 执行这些轨迹并收集经验回报(如任务成功与否、累积奖励),形成
(状态, 候选动作, 期望回报)的数据集。 - 该阶段相当于为 VLA 的原始输出空间构建了一个带奖惩标注的“离线决策库”。
2. 价值阶段:学习可部署的后果评估器
用搜索阶段收集的数据训练一个轻量级 Q 值模型,其输入为状态和候选动作,输出为预测的期望回报。
- 训练目标最小化 Q 预测与经验回报之间的误差(如 MSE 损失)。
- 引入不确定性正则化:通过模型集成或 dropout 估计 Q 值的预测方差,在后续选择时不仅考虑高 Q 值,还惩罚高风险的动作。
- 该阶段将 MCTS 的长期后果知识蒸馏到一个可快速推断的评价网络。
3. 行动阶段:评估引导的动作选择
部署时,流程如下:
- 给定视觉输入,冻结的 VLA 生成
k个候选动作(例如通过采样)。 - 用训练好的 Q 模型为每个候选动作计算不确定性正则化 Q 值(
Q_regularized = Q - λ * uncertainty)。 - 选择最高规范化 Q 值的候选动作作为最终执行动作。 整个过程无需访问仿真器,推理开销仅增加一次 Q 模型的前向计算。
与同类方法的差异
不同于通过微调或 RL 后训练修改 VLA 参数的做法,SVA 将动作提议与后果评估完全解耦,保留冻住骨干网络的泛化能力;同时将昂贵的树搜索知识蒸馏到轻量评估器,实现了测试时的仿真器无关扩展,在效果和效率上均优于直接缩放模型规模的方法。
实验
实验设计
SVA 框架在 EmbodiedBench 及多个 VLA manipulation benchmarks 上评估,任务包含未见过的泛化场景。核心流程为:1) 在模拟器中用冻结的 VLA 模型执行 MCTS,收集多样化轨迹并标注经验回报;2) 将搜索得到的回报知识蒸馏为一个轻量 Q-value 模型,用于预测候选动作的期望后果;3) 部署时,冻结 VLA 生成多个候选动作,由 Q-value 模型结合不确定度正则化选择最优动作,全过程无需访问模拟器。
关键发现
- 诊断结果:冻结 VLA 本身含有足够能力——
pass@1成功率仅 33%,但pass@32跃升至 92%,表明瓶颈在于动作评估而非生成。 - SVA 效果:解耦动作提议与后果评估后,冻结 VLA 在未见任务上的泛化成功率一致提升,且表现出明显的 测试时扩展行为(更多候选动作带来持续增益)。
- 惊人结论:9B 参数的 VLA + SVA 在比 27B VLA 推理延迟低 27% 的条件下,成功率高出 7 个百分点;说明扩展测试时评估比扩展模型规模更具成本效益。
与基线对比及工程启示
- 对比微调/RL 后训练:传统方法在提升特定任务性能时窄化通用能力;SVA 无需修改 VLA 主干,完全保留预训练的泛化性,类似于在已有策略上叠加一个"后果过滤器"。
- 对比简单采样:虽然
pass@k高成功率暗示采样可缓解问题,但 SVA 通过 Q-value 模型注入长期后果意识,比盲目采样更高效,且部署时无需模拟器支撑。 - 实际工程价值:轻量 Q-value 模型推理开销小,使中小型 VLA 达到甚至超越大型模型水平,为资源受限场景提供了一条从搜索中蒸馏决策常识、在推理时廉价复制的路径。
行业影响
落地场景
SVA 框架为部署 VLA(Vision-Language-Action)模型的机器人系统提供了即插即用的增强方案,适用于对泛化性和成功率要求苛刻的场景:
- 仓储物流机器人:分拣、搬运、装卸等操作任务,环境多变、物体杂乱,需快速适应未见过的物体与布局。
- 服务机器人:家庭或商业环境中的指令跟随操作,如整理物品、开门、倒水等,要求零样本泛化到新指令与新环境。
- 自动驾驶与无人机:复杂动态场景下的决策规划,需在测试时权衡多个候选轨迹的长期后果。
商业价值
SVA 的核心商业价值在于 降本增效,且不牺牲泛化能力:
- 推理成本大幅下降:用 9B 参数模型实现超越 27B 模型的成功率,推理延迟降低 27%,意味着在同等硬件下可支撑更大规模部署,直接降低 GPU 租赁或边缘设备功耗成本。
- 任务成功率提升:pass@k 诊断表明冻结 VLA 已具备优秀候选动作,SVA 通过评估器筛除劣质动作,将操作成功率从 33% 推高至 92% 级别,减少故障带来的停机与人工干预。
- 维持预训练泛化性:无需微调,避免灾难性遗忘,保护了基座模型在长尾场景上的通用知识,降低后续适配成本。
与现有产品 / 工作流的接口
SVA 以 插件形式 集成到现有 VLA 推理流水线,无需改动原始策略或仿真环境:
- 离线阶段:在仿真环境中使用 MCTS 采集(状态,候选动作,长期回报)数据,训练一个轻量级 Q-value 评估模型(通常为小型 Transformer 或 MLP)。
- 在线部署:VLA 模型输出多个候选动作(top-k 采样),Q 评估器计算每个动作的不确定性正则化 Q 值,选出最优动作执行。该过程可封装成
action = evaluate(propose(state), state)接口,无缝替换原始action = policy(state)调用。 - 与现有框架兼容:可直接嵌入 ROS 2 节点或 NVIDIA Isaac Sim 等中间件,作为动作后处理模块存在,不影响传感器数据流与控制频率。
具体落地 Use Case
电商仓储拣选: 在大型电商物流中心,机器人需抓取数十万种 SKU 的商品。预训练 VLA 模型能生成多种抓取姿态候选,但常因遮挡或奇形包装失败。部署 SVA 后,Q 评估器从候选姿态中筛选出成功概率最高且稳定的动作,将一次抓取成功率从 ~80% 提升至 ~95%,每年可减少数百万次人工复核,同时无需为每个新商品重新训练模型。
自动驾驶复杂路口决策: 在无信号交叉路口,自车需从多个变道或让行策略中选择。预训练端到端规划模型(类似 VLA 架构)可生成若干候选轨迹。SVA 评估器预测每个轨迹的安全到达概率和舒适性回报,选择不确定性最低的高回报轨迹,在未见过的路口环境中将安全通过率提高 10 个百分点,避免在线微调带来的风险,且可在车端以低延迟运行。
局限
- **依赖仿真环境进行搜索阶段训练**:SVA 在搜索阶段需要借助模拟器运行蒙特卡洛树搜索(MCTS)来收集轨迹并训练 Q 值评估器,这意味着对没有准确仿真环境的任务(如许多真实机器人操作场景)难以直接扩展。尽管部署时无需模拟器,但训练过程中的仿真质量直接影响评估器的可靠性,若仿真与真实世界存在较大域差距,蒸馏出的 Q 值模型可能失效。
- **评估器的分布锁定与迁移成本**:Q 值模型在固定的冻结 VLA 策略下学习,一旦 VLA 骨架更新(例如通过微调或换用更大的预训练模型),原有的评估器可能不再准确,需重新进行昂贵的搜索与蒸馏流程。这限制了方法在持续迭代的 VLA 生态中的灵活性,且每次迁移都需重新投入搜索算力。
- **搜索效率与测试时延迟的折衷**:虽然 SVA 在测试时仅需生成多个候选动作并查询 Q 值,但其推理延迟仍与候选数 k 成正比。与端到端的强化学习微调相比,SVA 无需改动模型权重,但引入了额外的候选生成和评估开销;与纯模型缩放相比,其延迟优势虽明显,但在资源极度受限的场景下仍可能成为瓶颈。此外,MCTS 搜索阶段的计算成本较高,可能限制其在资源有限团队中的普及。