论文

VLA 是否了解基础?衡量视觉-语言-动作模型中的常识与世界知识保留

VLA 是否了解基础?衡量视觉-语言-动作模型中的常识与世界知识保留

问题:具身视觉-语言-动作模型(VLA)通常通过对强大的预训练视觉-语言模型(VLM)进行微调获得,但适应后保留了多少常识与事实知识尚不明确。知识敏感任务上的失败难以归因,可能混淆了知识缺失与底层控制泛化不良。 方法:我们提出Act2Answer,一种轻量级协议,通过要求智能体以动作回答问题,将VLM知识基准适配到VLA评估。每个问题变为一个短桌面场景,智能体执行单个物体放置动作在候选答案中选择,从而得到动作接地成功率,减少控制混淆。我们构建了一个涵盖多种常识与世界知识类别的测试套件,并引入层意图探测来定位VLM骨干和动作头中与答案相关的信息。 实验与结论:在包含7个VLA模型和9个VLM基线的大规模研究中,我们系统地对模型按类别排序,发现:VLA在简单概念上表现稳健,但在较丰富语义类别上与其源VLM存在较大差距;VQA联合训练与更好的知识保留相关;答案相关信号在VLA中间层达到峰值,但在上层减弱。Act2Answer 代码开源。

论文精读

TL;DR Act2Answer 用动作回答替代文本问答,系统评估 VLA 模型在微调后的常识知识保留,发现高层语义知识衰减明显,VQA 协同训练有助缓解。

问题

问题背景

具身 VLA 模型主要通过微调强大的预训练 VLM 获得,旨在赋予机器人语言理解与动作执行能力。当前领域高度关注这类模型在下游操作任务上的表现,但系统性地衡量其常识与知识保留情况仍十分欠缺。

现有方法局限

传统评估将成功或失败归因于整体任务完成,无法区分失败根因——是模型遗忘了基本知识,还是低层控制未能泛化到新场景?直接沿用 VLM 知识基准(如 VQA)不涉及物理动作,无法反映具身场景中的真实知识调用。部分工作尝试在仿真环境中测试,但往往依赖复杂任务设置,评估目标与控制能力混淆,缺乏轻量、纯粹针对知识保留的行动接地协议。

为什么这个问题难且重要

VLA 模型在现实部署时经常依赖常识知识(如物体属性、空间关系、文化惯例)来理解模糊指令或处理未见组合。微调过程若不加以约束,极易引发灾难性遗忘,导致模型在掌握动作技能的同时丢失预训练阶段积累的世界知识。这在安全敏感领域(如家庭服务、人机协作)可能造成严重后果。技术上,知识表征分散在深度网络中,难以直接测量,且保留知识与学习新策略存在冲突,亟需一种解耦控制能力和语义理解的评估与分析工具。

行业类比

这类似于大语言模型经过领域微调后可能丢失通用问答能力——VLA 模型在学会操控机械臂时,也可能“忘记”物体大小常识,导致夹爪空抓或碰撞。

核心洞察

  • 将事实知识评估从语言回答迁移到物理动作,可以有效解耦“知识缺失”与“控制失败”,从而更纯粹地测量 VLA 模型的常识保留。传统 VLM 基准依赖文本输出,无法区分模型究竟是不知道答案还是无法正确执行动作。Act2Answer 通过单步物体放置动作来回答问题,动作接地的成功率减少了低级控制因素的混淆,使得知识评价更为可靠。
  • 层内意图探针发现,答案相关信息在 VLA 模型的中间层达到峰值,而在靠近动作头的上层衰减。这与 VLM 中知识多位于高层表示形成对比,暗示机器人微调可能在上层过度改写预训练知识。这一现象为 VLA 架构设计提供了指导:可通过冻结高层或引入知识蒸馏来保留常识,而非仅关注下游任务性能。

方法

Act2AnswerVLM 知识基准 转化为动作驱动的 VLA 评估,核心流程分为三步:

输入构造:从问题到操作场景

  • VLM 常识 / 世界知识基准 中选取多选题,将每个问题映射为一个桌面物品放置任务
  • 每道题的候选答案被渲染为颜色 / 纹理各异的物理方块,放置在桌面固定区域;问题文本转化为任务指令(例如“请把正确物品放到中心托盘”)。
  • 场景经域随机化(光照、视角、纹理),不保留原 VLM 基准的任何文本或视觉偏见,强制模型通过实体交互给出答案。

关键模块:动作回答与评估指标

  1. 单步动作执行:模型接收图像观察与自然语言指令,预测末端执行器的放置动作(抓取 + 释放),将某个方块移至指定目标区。
  2. 软成功率 (Soft Success Rate):不依赖严格二值判定。计算放置位置与正确答案区域的空间接近度,输出连续得分,能细粒度区分“部分知道”与“完全无知”,降低抓取失败等低级控制误差的干扰。
  3. 逐层意图探测 (Layerwise Intent Probing):在 VLA 的 VLM 骨干网络动作头 上插入线性分类器。冻结模型权重,用隐藏状态预测任务答案,逐层量化答案信息的保留程度。信号衰减位置指示 灾难性遗忘 的发生层。

输出与对比

  • 输出每个知识类别的动作成功率层探测曲线,刻画出 VLA 在简单概念(如颜色/形状)保持较好,但在丰富语义类别(如功能推理)上较源 VLM 大幅下降。
  • 与同类评估差异:传统 VLA 评测多混合低层控制与高层知识,Act2Answer 通过单步动作解耦知识保留,直接用动作成功率度量模型“知道多少”,而非“操作多好”。

实验

实验设计

Act2Answer 协议将现有 VLM 知识基准转化为可直接在具身环境中评估的任务。每个问题被映射为一个桌面操作片段,代理需通过单次物体放置动作来选择答案,从而输出动作驱动的成功率(action-grounded success rate),减少低层控制干扰。作者构建了涵盖多种常识与世界知识类别的测试套件,并引入逐层意图探测(layerwise intent probing),沿 VLM 主干和动作头定位与答案相关的表征。研究涵盖 7 个 VLA 模型和 9 个 VLM 基线,系统比较了不同语义类别下的知识保留程度。

关键发现

  • 简单 vs. 复杂概念:VLA 在基本概念上表现稳健,但在需要丰富语义理解的类别上与源 VLM 差距明显,说明知识在微调过程中有所流失。
  • VQA 协同训练的作用:在微调阶段引入视觉问答(VQA)训练的模型,知识保留更好,表明多任务监督有助于缓解遗忘。
  • 知识信号的层级分布:意图探测显示,与答案相关的信息在 VLA 中间层达到峰值,但在靠近动作头的上层衰减,暗示知识传递存在瓶颈。

基线对比与工程启示

与直接使用源 VLM 进行知识评估不同,Act2Answer 量化了从语言感知到动作执行的完整通路中知识的可用性。实验发现VLA 模型普遍弱于对应 VLM,但差距大小取决于类别和微调策略。这为工程实践提供明确方向:在设计 VLA 时,应保留或仿照 VQA 类训练信号,并在动作头之前注入中间层知识表征,以减少上层衰减。层探测技术本身可作为诊断工具,用于快速评估新 VLA 架构的知识保留能力,避免昂贵的大规模具身测试。

行业影响

落地场景

Act2Answer 协议可直接嵌入机器人公司的 VLA 模型迭代流程,适用于依赖常识与世界知识的具身场景:服务机器人(如酒店配送、家庭助理)需理解“花瓶易碎应放在桌面中央”,仓储物流机器人需根据物品属性(如“冷冻食品需放入冷柜”)规划抓取与放置,工业协作臂在与人交互时需推断工具的典型用途。该测试套件可快速筛选出知识薄弱点,避免将推理缺陷错误归因为控制泛化差。

商业价值

通过识别 VLA 模型在语义丰富类别上的性能下降,Act2Answer 帮助团队在微调阶段提前发现知识流失,减少后期真机调试与事故成本。对于提供机器人即服务(RaaS)的企业,更高的常识保留率直接提升任务成功率与用户信任,降低人工介入频率。此外,VQA 联合训练被证实是有效的知识保持策略,可指导训练配方选择,形成差异化模型能力,提高产品竞争力。

与现有产品 / 工作流的接口

该协议作为轻量级评估层,可集成进 MLOps 流水线:在每次 VLM→VLA 微调后自动运行 Act2Answer 基准,输出各语义类的软成功率层意图探测结果,作为是否发布模型的 gate。它与现有 VLM 评估生态(如 MMLU、VQA-v2)自然衔接,且环境搭建简单(桌面级仿真,单次物体放置),可无缝插入 CI/CD。工程团队可据此建立知识保留的监控看板,指导数据配比与微调超参调整。

具体落地案例

  • 电商仓储:拣选机器人根据订单文本(“请将有机燕麦片放入早餐组合箱”)中的常识知识(有机食品与健康早餐关联)准确执行,Act2Answer 能在上线前评估模型是否丢失该类关联,避免错拣。
  • 智能家居:扫地机器人在语音指令“把地上的玩具收到角落”中需理解“玩具”是易碎小物体,评估框架可验证模型是否保留此类物理常识,防止粗暴推扫导致损坏。

局限

  • **任务与场景受限**:Act2Answer 环境仅限于桌面物体放置任务,无法覆盖移动操作、多步推理或动态交互等更广泛的具身场景。虽然降低了控制混淆,但评估结果可能无法直接迁移至真实机器人应用,其评估的生态效度有待扩展验证。
  • **知识类别覆盖不足**:基准测试涵盖的常识和世界知识类别多改编自 VLM 基准,可能忽略具身环境特有的知识需求(如物理常识、空间关系等)。此外,对开放域知识或组合性知识评估的缺失,可能低估了 VLA 模型在更复杂任务中的知识退化程度。
  • **探测分析仅提供相关性**:分层线性探测表明答案相关信息集中在中层,但无法揭示信息利用的因果关系或微调导致知识损失的具体机制。缺乏干预性实验(如消融或表征操作)来验证探测到的表征是否真正驱动行为,难以为模型改进提供直接指导。
论文Nikita Kachaev2026-06-17原文

相关内容