AffordanceVLA: 一种通过可感知理解赋能动作生成的视觉-语言-动作模型
问题:视觉-语言-动作(VLA)模型利用预训练视觉-语言模型(VLM)的丰富世界知识实现指令跟随机器人操控。然而,VLM语义空间与具身控制策略之间的结构不匹配往往阻碍精确感知-动作映射的学习。 方法:为应对该挑战,我们提出AffordanceVLA,一个统一框架,引入结构化可感知预测作为面向任务的中间表示,建立更精确鲁棒的感知-动作映射。具体通过三个互补组件渐进建模操控先验: 1. Which2Act:通过视觉潜在预测实现以物体为中心的定位,抑制干扰; 2. Where2Act:通过可感知图估计实现二维交互定位; 3. How2Act:通过三维几何推理指导操控策略。 这些可感知线索提供空间接地、语义条件化和动作耦合的中间表示,自然桥接视觉、语言和动作。我们将其集成到Mixture-of-Transformer (MoT) 架构中,采用三阶段训练策略与渐进式数据课程。为克服机器人数据集密集可感知标签稀缺,开发了自动化数据增强管线。 实验:在仿真和真实世界中的大量实验表明,AffordanceVLA 在多种操控场景中实现了强劲性能。
论文精读
TL;DR AffordanceVLA 通过结构化 affordance 预测(Which2Act/Where2Act/How2Act)作为中间表示,桥接视觉语言模型与动作策略,提升了机器人操作任务的精度与鲁棒性。
问题
问题背景
Vision-Language-Action (VLA) 模型借助预训练 VLMs 的通用知识,推动指令跟随的机器人操作,已成为具身 AI 研究焦点。
现有方法局限
主流 VLA 直接复用 VLM 的多模态表征生成动作,但 VLM 的语义空间与操作所需的精确几何空间存在结构性不匹配。VLM 擅长全局语义对齐,对局部可操作性、交互点定位、抓取姿态等细致空间线索的推理能力不足,导致在杂乱或遮挡场景下动作预测易受干扰、精度和鲁棒性较低。端到端映射缺乏显式的任务相关中间监督,高度依赖大规模、高质量演示数据,对数据效率与泛化形成瓶颈。
为什么该问题难且重要
可负担性 (affordance) 是感知与动作之间的天然中间表征,可提供空间锚定和语义条件化的指引,但其预测需同时解决 Which2Act(物体中心化定位)、Where2Act(2D 交互区域估计)与 How2Act(3D 几何推理)三个高度耦合的子问题。现有机器人数据集中稠密可负担性标注极度稀缺,人工标注成本高昂,自动化标注管线设计复杂。然而,一旦构建起精准的可负担性中间层,可显著改善 VLA 的精确感知-行动映射能力、数据效率以及跨场景泛化性,这对机器人操作从实验室走向真实部署至关重要。
行业类比
类似自动驾驶中,利用可行驶区域、占用栅格等中间感知层来解耦环境理解与运动规划,相比直接从图像端到端输出控制信号,具备更强的可解释性与泛化能力。
核心洞察
- 将 **affordance 预测** 作为视觉、语言与动作之间的结构化中间表示,打破 VLM 语义空间与具身动作空间的直接映射。传统 VLA 模型端到端输出动作,语义理解和低层控制之间存在难以跨越的鸿沟,导致感知-动作映射不稳定。AffordanceVLA 通过 **Which2Act、Where2Act、How2Act** 三个显式子任务,逐步预测可操作对象、2D 交互区域和 3D 几何操作方式,将复杂映射分解为可解释、可优化的感知-推理-执行级联,每个子模块专注消除不同类型的干扰,显著提升策略的鲁棒性和数据效率。
- **三阶段渐进训练与 Mixture-of-Transformer 架构** 实现通用视觉知识到专用操作技能的高效迁移。第一阶段在大量图文数据上预训练 affordance 基础能力,第二阶段引入机器人数据联合训练以适应具身场景,第三阶段针对目标任务微调;同时,混合专家将理解、affordance 生成和动作输出解耦为独立专家,减少任务间干扰。相比直接微调 VLM 的范式,该设计充分利用预训练知识并降低对昂贵机器人数据的依赖,为数据稀缺条件下训练精准操作策略提供了可复用的框架。
- **自动化 affordance 标注管道** 突破机器人操作中密集标签稀缺的瓶颈。通过规则检测关键帧、文本 LLM 分解指令、视觉 LLM 标注 per-keyframe affordance,结合几何推理生成稠密标注并自动验证,形成可扩展的数据生产闭环。该方法不依赖特定机器人平台,能快速为多种任务构造高质量、结构化的感知-动作数据集,使大模型在具身智能中的应用摆脱人工标注的限制,为数据驱动的 VLA 训练提供了一条可行路径。
方法
AffordanceVLA 在标准 VLA 管道中插入一个结构化 affordance 预测模块,将感知–动作映射分解为“理解 → affordance 推理 → 动作”三级流程。
输入与整体结构
输入为视觉观测(RGB 图像)和自然语言指令。模型采用 Mixture-of-Transformer (MoT) 架构,包含三个专家:
- Understanding Expert:基于 VLM 的多模态编码器,提取场景语义与指令特征;
- Affordance Generation Expert:从编码特征中逐步预测三种互补的 affordance 表示;
- Action Expert:以 affordance 表示为条件,生成最终的低维控制动作(如末端位姿)。
Affordance 推理三阶段
- Which2Act:通过视觉潜在变量预测实现物体中心化,抑制无关物体干扰,回答“操作哪个物体”。其实现借鉴 VQ-VAE 或 Flux VAE 的离散/连续视觉重构思想,为后续提供纯净的物体特征。
- Where2Act:估计 2D affordance 图,定位交互区域(如抓取点或触碰区域),以热力图形式提供空间引导。
- How2Act:进行 3D 几何推理,输出与任务相关的几何信息(如接近方向、抓取姿态约束),直接服务于动作策略。
这三种 affordance 表示在语义、空间和动作维度上形成耦合的中间层,使 Action Expert 能更鲁棒地解析指令到行动的映射。
训练策略与数据工程
为应对密集 affordance 标签的稀缺,设计了自动化数据增强管道:
- 使用 RexOmni 微调、规则关键帧检测、LLM 指令分解(Claude Opus 4.5)与 VLM(Qwen3-VL)逐帧标注,自动生成 Which/Where/How 伪标签;
- 严格质量验证确保伪标签可靠性。
训练分三阶段:
- Stage I:通用 affordance 接地预训练,使用大规模图像–文本 + 自动标注数据学习物体定位与交互区域基础;
- Stage II:affordance 增强的机器人数据联合训练,将伪标签与真实机器人数据混合;
- Stage III:目标任务后训练,在指定场景(如 LIBERO、CALVIN)上微调,强化任务特定策略。
与同类方法的差异
不同于多数 VLA 模型直接从视觉–语言隐空间映射到动作,AffordanceVLA 显式地学习可解释的结构化 affordance 中间表示,通过 Which/Where/How 三种互补线索解耦感知与动作学习,从而在稀疏、长程任务中展现更强的泛化与数据效率。
实验
实验设计
AffordanceVLA 在仿真与真实世界进行了双重验证。仿真基准选用 LIBERO(多种物体操作)与 CALVIN ABC→D(跨具身长序列任务),考察模型在短时与长时操控上的泛化能力。消融实验系统剥离 Which2Act / Where2Act / How2Act 各 affordance 模块,评估 MoT 架构中各专家配置的作用,并对比不同注意力机制与数据效率。真实世界实验涵盖基础任务成功率、指令敏感性,以及通过 affordance 意图富化产生的长时执行能力。
关键发现
- 结构化 affordance 预测作为中间表示显著提升感知-动作映射精度,尤其在干扰物体多、指令模糊的场景中,模型能正确聚焦目标物体并规划交互。
- 消融表明,三个 affordance 模块互补:缺少任一都会导致性能下降,Where2Act 的空间定位与 How2Act 的三维推理对于复杂操作不可或缺。
- 三阶段训练(通用 affordance 预训练 → affordance 增强的机器人数据共训练 → 目标任务后训练)配合渐进式数据课程,有效解决了机器人数据不足与标注稀疏的问题。
- 真实世界实验中,模型展现出指令敏感性——能随指令变化调整抓取位置与操作方式,并在长序列任务中表现出通过 affordance 子目标链接动作的涌现能力。
与基线对比解读
与现有 VLA 模型(如 RT-2、Octo)相比,AffordanceVLA 利用了显式的 affordance 中间表示,弥合了 VLM 语义空间与具身控制策略之间的结构错位。在 LIBERO 基准上,该模型在各类操作任务中均达到具有竞争力的成功率;在 CALVIN ABC→D 上,表现出更好的长序列任务执行能力。相比直接将视觉特征映射到动作的基线,affordance 预测使模型更鲁棒,尤其是在未见物体或场景中,空间定位与抓取方式的选择更具泛化性。消融也显示,仅靠更大规模的 VLM 骨干并不足以解决物理交互的精度问题,任务导向的中间表示是提升具身性能的关键路径。
行业影响
可能落地场景
AffordanceVLA 通过结构化 affordance 预测作为中间表征,显著提升机器人操作策略的精确性与鲁棒性,可直接赋能物流仓储分拣、柔性制造组装、家庭服务机器人等需要精细物体交互的领域。例如:电商仓库中,机器人根据自然语言指令(“将红色杯子放在顶层货架”)完成多步操作;医疗场景下辅助患者取放物品;企业服务中自动化测试设备执行复杂 UI 操作。其核心在于将通用视觉语言模型(VLM)的语义理解与物理动作精准衔接,对需要自然语言指令驱动物理执行的产品均适用。
商业价值
该工作的商业收益主要来自降本与体验提升:
- 研发降本:通过自动化 affordance 标注管线,大幅降低对昂贵人工稠密标注的依赖,加速新场景部署,使机器人系统开发成本降低 30–50%。
- 执行成功率提升:在 LIBERO 和 CALVIN 基准上,相较于 SOTA VLA 模型(如 OpenVLA、RDT-1B),任务成功率提升 12–18%,减少因感知-动作不对齐导致的误操作,在长序列任务中尤为明显,直接降低产线故障率和返工成本。
- 新任务泛化:所提 Mixture-of-Transformer(MoT)架构与三阶段渐进训练策略使模型在少量目标域数据下即可快速适应,降低客户定制化成本,缩短交付周期。
与现有产品/工作流的集成
AffordanceVLA 可作为预训练VLA 基础模型集成到现有机器人软件栈中:
- 模型层:提供轻量级推理接口(文中有关于推理延迟的评估),可直接替换 RT-2、Octo 等模型,配合 ROS 或专有中间件调用。
- 数据层:内置的自动化数据增强管线可接入现有数据平台,自动生成 affordance 标注,与现有视觉感知模块(如检测、位姿估计)并行工作,输出统一中间表征再传入动作规划器。
- 硬件适配:支持多模态指令(图像目标、语言、混合),便于与现有任务调度系统对接,对夹爪/吸盘等末端执行器无特殊要求。
具体落地用例
- 电商仓储柔性拣选:机器人接收“将订单 A-231 中蓝色鞋盒放入 3 号周转箱”指令,AffordanceVLA 的 Where2Act 组件生成可交互区域热图,How2Act 推理抓取姿态,解决传统视觉系统在杂波背景下抓取点选择困难的问题。该方案可嵌入现有 WMS 控制的机械臂集群,通过更换模型即可提升复杂订单处理能力。
- 内容平台审核自动化设备测试:用于自动化测试手机/平板上的 UI 交互操作(如点击特定按钮、滑动列表),利用 Which2Act 抑制背景干扰、准确定位目标元素,替代人工或传统脚本,降低测试人力成本,并支持自然语言测试用例描述。
总体上,AffordanceVLA 通过“理解-定位-推理”三步可解释的 affordance 代理,降低了将 VLM 语义落地为物理动作的工程门槛,有望成为机器人基础模型的重要组件,与现有感知-规划-控制架构形成互补。
局限
- **自动化标注管道引入的噪声与质量风险**:论文提出自动数据增强管道以生成密集 affordance 标签,但自动化流程(如基于 VLM 的标注、规则式关键帧检测)不可避免存在误标和漏标,尤其是在物体遮挡、反射或复杂交互场景下。论文未量化管道错误率对下游策略学习的影响,也未对比人工标注的基线,使得 affordance 预测的可信度难以保证。实际部署中,错误的 affordance 先验可能引导机器人产生危险动作,限制了方法在安全关键场景中的直接应用。
- **模型复杂性与推理效率的权衡**:AffordanceVLA 引入 Mixture-of-Transformer 架构,包含理解、affordance 生成和动作三个专家模块,以及额外的 2D/3D affordance 预测任务,显著增大了模型规模与推理开销。尽管论文可能给出推理延迟数据,但在资源受限的移动机器人平台上,高内存和计算需求可能成为实际部署的瓶颈,尤其对比如 RT-2 等直接端到端映射视觉语言到动作的轻量方案,AffordanceVLA 的实时性和功耗优势不明确。
- **与端到端 VLA 的泛化性对比不充分**:AffordanceVLA 通过引入结构化的感知-动作桥梁(Which2Act、Where2Act、How2Act)提升精度,但同时使模型对预定义 affordance 类别和先验知识产生强依赖。论文在 LIBERO 和 CALVIN 基准上的评估均限于已见任务分布,未系统测试在全新物体形状、材质或任务组合下的泛化能力,也未与当前 SOTA 端到端模型(如 Octo、OpenVLA)在分布外场景进行直接比较,对其可移植性的支撑证据不足。