论文

AFUN: 迈向用于功能理解的可供性基础模型

AFUN: 迈向用于功能理解的可供性基础模型

可供性理解连接视觉感知与物理行动,是机器人在开放非结构化真实环境中进行可解释操控的接口。然而,构建一个不仅理解交互位置与方式、还能跨环境、物体和任务泛化的可供性基础模型仍是长期挑战。现有方法通常只解决部分问题:或定位任务相关区域而未指定可执行运动,或预测运动但扩展性有限。 本文提出AFUN模型,向功能理解的可供性基础模型迈进一步。从单张RGB-D观测和语言任务描述出发,AFUN预测任务条件功能掩码(交互位置)和3D接触后运动曲线(交互方式)。为支持开放世界泛化,我们构建大规模标准化数据流水线,将异构机器人、人类、仿真和真实扫描数据转换为统一的可供性模式,包含语言、掩码和以物体为中心的3D运动标签。 我们从三方面评估AFUN:1)可供性分割:在4个基准的8个测试集上大幅超越所有基线,平均gIoU/cIoU提升+23.9/+26.3;2)接触点预测:预测点更精确,命中率比最佳基线高12.7%–61.3%;3)3D运动:在所有三个测试集上取得最佳性能。AFUN可直接部署于真实机器人操控,无需针对机器人本体微调或使用任务特定启发式,展现适应开放世界可供性任务的能力。项目页面:https://www.zhaoningwang.com/AFUN

论文精读

TL;DR AFUN 从单张 RGB-D 和语言指令同时预测交互掩码与 3D 接触后运动曲线,通过大规模异构数据管线实现跨环境、跨物体的通用机器人操作,性能大幅领先现有基准。

问题

Affordance 理解 作为连接视觉感知与物理动作的桥梁,正成为机器人操作在开放环境中实现可解释交互的核心研究方向。当前业界关注如何从单帧观测生成可执行的交互指令,使机器人能适应多样化物体与任务。

现有方法的局限

现有工作多将 affordance 分解为独立子问题,未能形成统一模型:

  • 仅定位交互区域的方法(如 affordance segmentation)输出 2D 掩码或接触点,但缺乏可执行的运动信息,机器人无法得知“如何操作”。
  • 预测运动轨迹的方法往往依赖特定机器人本体或预定义动作基元,扩展性差,难以泛化到新物体类别或未见任务。
  • 多数方法基于 2D 图像或固定视角,未充分利用 3D 几何与物体中心表示,导致 motions 与实际交互存在偏差。

技术挑战与重要性

构建 Affordance 基础模型 面临双重挑战:

  1. 输出复杂性:需同时预测“何处交互”的功能掩码和“如何交互”的 3D 接触后运动曲线,二者在几何和语义上必须一致。
  2. 数据异质性:真实场景中机器人、人类、仿真等多源数据格式不同,如何将其对齐到统一的语言-掩码-3D 运动标签模式,是支撑开放世界泛化的关键。

业界迫切需要一个类似视觉基础模型(如 SAM)的通用 affordance 模块,使机器人能在无微调、无任务启发式的情况下,直接根据语言描述和 RGB-D 观测生成可靠动作。

行业类比

SAM 使图像分割走向通用化类似,AFUN 尝试为机器人操作提供统一的“何处交互”与“如何交互”基座,有望降低开放环境中机器人编程与泛化的门槛。

核心洞察

  • 统一交互位置与动作的 affordance 表征:现有方法或定位可交互区域但不提供可执行动作,或给出运动轨迹但缺乏泛化性。AFUN 从单张 RGB-D 和语言指令中同时输出功能掩码与 3D 后接触运动曲线,将“在哪里交互”与“如何交互”联合建模,实现更完整的机器人操作功能理解。
  • 异构数据标准化流水线驱动开放世界泛化:通过构建跨机器人、人类、仿真等多源数据的统一 affordance schema,AFUN 将多样化的交互数据转换为包含语言、掩码和物体中心 3D 运动标签的标准化格式,使模型能够学习到与环境、物体和任务无关的通用 affordance 知识,从而在多种基准和真实场景中展现出强泛化能力。

方法

AFUN 以单帧 RGB-D 观测和自然语言任务描述(如“打开抽屉”)作为输入,直接预测任务条件功能掩码(在哪里交互)与三维后接触运动曲线(如何交互),实现从感知到动作的端到端可解释输出。

核心架构

模型围绕三个关键设计展开:

  • MetaQuery 条件化:将语言任务描述嵌入为一组元查询(MetaQuery),注入分割与运动解码分支,引导模型关注任务相关区域与动作。
  • 分割与运动解码头:基于预训练的分割基础模型(类似 SAM),共享视觉编码器,并行输出逐像素的功能掩码和接触区域预测;运动分支额外输出三维关键点位移序列。
  • 曲线运动表示(Curved Motion Representation):不使用完整稠密轨迹,而是将接触后运动参数化为低维控制点曲线,再通过多项式拟合恢复连续动作。这种表示大幅压缩运动自由度,提升回归稳定性与泛化性。

训练采用三阶段课程:

  1. MetaQuery–SAM3 对齐:仅优化投影层,使 MetaQuery 与视觉特征空间语义一致。
  2. 端到端功能分割训练:固定视觉编码器,联合训练 MetaQuery 与分割头,学习任务条件掩码。
  3. 运动与分割联合训练:解冻全部参数,同时监督掩码和曲线参数回归,实现两个子任务的协同学习。

与同类方法的关键差异:现有工作通常孤立处理“位置”与“动作”,如仅预测任务相关热力图却不输出可执行运动,或只预测运动轨迹但难以跨物体、跨场景泛化。AFUN 首次通过统一架构联合预测功能掩码与接触运动,并依托跨异构数据源(机器人、人类、仿真、扫描)的大规模标准化数据管道,实现了开世界零样本迁移,无需针对机器人实施例微调或依赖任务专有启发式规则。

实验

实验设计

  • AFUN 在三大核心任务上进行评估:affordance segmentationcontact-point prediction3D motion prediction
  • 分割任务覆盖 4 个基准的 8 个测试集,包含真实扫描、仿真与机器人操作场景;接触点预测在多个数据集上测试命中率;3D 运动评价使用三个专用测试集。
  • 基线方法涵盖纯定位模型、运动预测模型及联合预测模型。训练策略分三阶段:MetaQuery–SAM3 对齐、分割独立训练、运动与分割联合微调。

关键发现

  • 分割性能大幅领先:AFUN 的 mean gIoU 提升 +23.9,cIoU 提升 +26.3,在开放世界场景中展现出极强的通用性。
  • 接触点预测精准:相比最佳基线,hit-rate 提升幅度达 12.7% 至 61.3%,验证了模型对“哪里交互”的细粒度理解。
  • 3D 运动指令切实可行:在三项运动预测测试中均取得最优结果,可直接部署到真实机器人操作,无需针对具体本体的微调或手工启发式。

与基线的深度对比

  • 现有方法通常只解决单一子问题:区域定位不产生可执行运动,或运动模型缺乏开放场景扩展性。AFUN 首次将 task-conditional functional mask3D post-contact motion curve 统一在单个前向推理中,从 RGB-D 和语言直接输出完整的交互行为。
  • 性能增益的核心并非更大模型,而是大规模标准化数据管线:将异构的机器人、人类、仿真、扫描数据转化为一致的功能描述(语言、掩码、物体坐标系下的 3D 运动曲线),使模型学到跨环境、跨物体的通用功能先验。
  • 接触点预测的巨大增幅(某些测试集超 60%)表明,2D 功能掩码提供的强空间先验对 3D 运动生成产生了显著的协同效应,超越了独立预测方案的上限。

行业影响

落地场景

AFUN 可通过单次 RGB-D 观测与语言指令直接输出交互区域与三维运动曲线,为多种机器人产品提供开箱即用的功能理解能力。典型落地包括:

  • 仓储与电商物流:分拣机器人根据自然语言任务(“抓取包装盒”“打开抽屉”)自主生成抓取位姿与运动轨迹,无需针对 SKU 预先建模。
  • 服务与家庭机器人:在非结构化环境中响应“帮我把杯子放到托盘上”等指令,自适应家具、物品的位姿变化。
  • 工业柔性装配:结合力控,为插入、按压等接触动作生成实时可执行轨迹,减少人工示教。
  • AR/VR 交互:将物理对象的功能区域与运动参数投射到增强现实界面,辅助远程协作与培训。

商业价值

AFUN 沿着三条线创造收益:

  1. 降本:将传统机器人编程的逐任务人工成本转化为仅提供语言描述,自动化率显著提升,尤其是中小批量、多品类场景。
  2. 增收:使机器人能够处理长尾任务与未见物体,扩展自动化边界,例如按需抓取退货包裹或个性化装配,解锁新业务。
  3. 体验提升:自然语言接口降低使用门槛,非专家也能快速部署,同时泛化能力减少频繁 re-training 带来的停机。

与现有工作流的接口

AFUN 可无缝嵌入现有机器人软件栈:

  • 感知层:消费级 RGB-D 相机 + SAM 系列分割模型提供初始掩码,AFUN 作为通用 affordance 头附加。
  • 规划控制层:输出的 task-conditional mask 可直接转化为抓取位姿,3D post-contact motion curve 作为末端执行器路径输入到运动规划器(如 MoveIt)。
  • 数据闭环:标准化的数据管道可将新增场景生成结构化数据集,持续微调模型,形成飞轮。

具体落地 Use Case

  • 电商逆向物流:退货仓中,机器人接收“取出鞋盒内的鞋子”指令,AFUN 从杂乱箱子堆中定位鞋盒开口区域并生成掀开—拿取的运动曲线,无需预先 CAD。
  • 医疗康复辅助:外骨骼或辅具机器人根据患者意图“拿起水杯”,AFUN 实时预测杯子把手的功能区域和握持运动,适应不同杯型与患者姿势,提升人机交互安全性。

局限

  • **运动表示的简化假设**:AFUN 使用 3D 后接触运动曲线描述操作,假设了刚体交互和单阶段接触后轨迹。但真实操作常涉及物体形变、多步接触或力控变化,曲线表示无法覆盖这类精细的物理交互。例如,拧瓶盖需要旋转副手势与持续的力反馈,单一运动曲线难以完整表达。这限制了其在需要复杂接触动力学任务上的精度。
  • **开放世界泛化仍受数据多样性约束**:尽管 AFUN 构建了多源数据管线并统一为 affordance 标注,但实际部署中发现,当面对与训练分布差异显著的物体类别或场景时,功能掩码与运动预测质量下降。当前管线覆盖的交互类别仍有限,大规模自动标注(如 vLLM 生成查询、曲线拟合)可能引入噪声标签,影响模型对细粒度任务的理解。
  • **系统设计依赖 RGB-D 输入**:AFUN 必须同时获取 RGB 和深度信息,这使其无法直接应用于许多仅配备单目 RGB 相机的低成本机器人平台。尽管深度信息提升了 3D 定位精度,但也增加了采集硬件的门槛,限制了在更广泛部署中的即时可用性。
论文Zhaoning Wang2026-06-01原文

相关内容