Attention-DP3: 通过几何对齐注意力条件化的空间物体感知 3D 扩散策略
3D 点云观测在复杂、杂乱的操控场景中天然存在歧义:目标物体可能被部分遮挡,或与外观相似的干扰物紧密混杂。因此,随着场景复杂度上升,标准的 3D 扩散策略 往往难以定位并利用任务相关的几何结构。 为此,我们提出 Attention-DP3,一种空间物体感知的 3D 扩散策略。它在保持 DP3 扩散主干不变的前提下,通过注意力机制注入物体级几何线索。流程如下: 1. 在 RGB 图像上执行 开放词汇 2D 分割; 2. 利用标定好的相机几何把预测的目标掩码提升到 3D,得到以物体为中心的几何先验; 3. 通过 Tri-field Attentional Conditioning 注入线索,构造三个互补场:targetness field 锚定目标物体,intra-target saliency field 强调目标内部与任务相关的几何,backgroundness field 抑制干扰物与杂乱背景。 在 Adroit、DexArt、MetaWorld 以及真实世界 SO101 平台上的实验表明,该方法相较 DP3 取得一致提升,并在各基准上达到 SOTA 性能。值得注意的是,随着干扰物数量增加,DP3 性能急剧下降,而 Attention-DP3 保持稳定,在重度杂乱场景下最高超越 DP3 达 31%。代码已开源:https://github.com/zhangzhongbo2213/Attention-DP3 。
论文精读
TL;DR Attention-DP3 用开放词汇 2D 分割获得目标掩码并提升到 3D,通过三场注意力条件(targetness、intra-target saliency、backgroundness)注入 DP3,使杂乱场景成功率最高提升 31%,不改动 backbone。
问题
问题背景
在机器人操作模仿学习领域,3D 点云 作为观察输入受到越来越多的关注,因为它能提供精细的几何信息,提升策略对物理交互的理解。
现有方法局限
以 DP3 为代表的 3D 扩散策略将整段点云编码进特征空间,缺少对目标物体的显式区分能力。当场景中出现部分遮挡或视觉相似的干扰物时,策略的注意力容易被背景点或干扰物分散,导致动作生成不稳定。实验表明,随着干扰物数量增加,DP3 的成功率急剧下降——这是因为点云特征本身不携带语义先验,网络难以自适应地聚焦于任务相关区域。
为什么这个问题难 / 重要
核心挑战在于 3D 场景的歧义性:目标物体可能被遮挡,或与外观相近的干扰物紧密混杂。虽然 2D 视觉基础模型可以准确分割目标,但将 2D 语义可靠地提升到 3D 点云,并在不改变扩散骨干的前提下有效注入策略,仍是一个开放问题。业界对更鲁棒的机器人操作策略需求强烈,尤其是在非结构化的仓储分拣、家庭服务等场景中,系统必须在高复杂度环境下保持稳定表现。
行业类比
类似自动驾驶中的 3D 目标检测需要应对拥挤交通里的遮挡与相似物体误检,机器人操作同样需要在杂乱环境中稳定锁定目标物体。
核心洞察
- 显式对象感知的几何先验注入:利用开放词汇2D分割与相机几何将目标mask提升到3D,构造**targetness** / **intra-target saliency** / **backgroundness** 三个互补场,并通过交叉注意力条件化到DP3的扩散过程中。与标准DP3直接处理原始点云相比,这种显式对象先验解耦了目标定位与背景抑制,使模型在部分遮挡、相似干扰物密集的场景下仍能聚焦任务相关几何,从而避免扩散策略在复杂场景中的混淆。
- 保持backbone不变,以注意力条件实现即插即用增强:Attention-DP3不修改DP3的扩散主干网络,仅增加轻量级场编码器和交叉注意力层,即可将对象级先验注入。这种低侵入性设计允许现有3D扩散策略系统几乎零成本地获得显著性能提升,尤其在干扰物数量增加时性能保持稳定,最多超过DP3达31%。对工程实践而言,这意味着无需重训或重构大规模模型,只需替换观察条件模块即可提升复杂操作任务的可靠性。
方法
方法流程
输入:RGB-D 观测与开放词汇文本查询。
2D 分割与 3D 提升:在 RGB 图像上使用开放词汇分割模型(如 Grounding DINO 或类似模型)预测目标 mask,然后利用标定相机内外参将 mask 反投影到 3D 点云,获得目标点集与场景点云的空间对应关系。
Tri-field 构造:基于目标点集与场景点云计算三个几何对齐的注意力场:
- targetness field:对目标物体区域赋予高注意力权重,用于锚定任务物体位置。
- intra-target saliency field:在目标内部区分与任务相关的局部几何(如接触点、可抓取部位),强调关键子区域。
- backgroundness field:显式标记背景与干扰物体,在注意力中施加抑制,降低杂乱场景带来的干扰。
Attention-conditioned Diffusion Policy:将三个场编码为逐点或逐体素的特征向量,作为注意力条件注入 DP3 扩散策略的特征提取与去噪过程;原始 DP3 网络结构保持不变,仅通过附加注意力分支实现条件融合。
输出:根据当前观测与文本提示生成面向目标物体的操控动作序列。
与直接使用原始点云的 DP3 相比,Attention-DP3 通过显式物体级几何先验和注意力调制,使策略在复杂杂乱场景中保持稳定,而无需修改扩散骨干或依赖隐式特征学习。
实验
实验设计
在 Adroit、DexArt、MetaWorld 三个仿真基准和真实机器人平台 SO101 上进行评估。基线为 DP3,使用相同的数据收集和训练协议。重点测试对视觉杂乱(visual clutter)的鲁棒性,通过逐步增加干扰物数量来对比性能。此外进行多项消融研究:注意力场组成、融合策略、推理延迟、失败模式、不完美 2D 感知和不同感知基础模型的影响。
关键发现
Attention-DP3 在所有基准上均一致优于 DP3,并达到 SOTA。最显著的增益出现在干扰物密集的场景:随着干扰物数量增加,DP3 的成功率急剧下降,而 Attention-DP3 保持稳定,在重杂乱环境下相对 DP3 提升最高 31%。这表明对象级几何先验有效缓解了 3D 点云观测的歧义。
与基线的深度对比
DP3 直接使用点云作为输入,缺乏对任务相关几何的显式关注,在目标被遮挡或与相似干扰物混杂时容易混淆。Attention-DP3 保持 diffusion backbone 不变,仅通过 Tri-field Attentional Conditioning 注入条件信号:targetness 锚定目标,intra-target saliency 强调目标内部的任务相关几何,backgroundness 抑制干扰物。这种设计使得策略能够“关注”正确区域,且无需改变底层网络结构,可作为一种即插即用的增强模块,对实际部署非常友好。
行业影响
落地场景
Attention-DP3 直接适用于机器人操作中高杂波、部分遮挡的物体抓取与装配任务。典型部署包括:
- 电商履约中心:料箱内混杂多种 SKU,机器人需从杂乱堆叠中准确抓取目标商品,鲁棒性提升可减少人工二次分拣。
- 3C 电子装配:精密零件在多托盘上混放,视觉干扰物多,对象感知的注意力条件可稳定定位目标零件。
- 服务机器人:家庭或商用场景中,机器人需从桌面杂物中识别并拿起用户指定物品,开放词汇 2D 分割允许灵活设定目标 query。
商业价值
论文显示,在干扰物数量增加时,标准 DP3 性能急剧下降,而 Attention-DP3 保持稳定,最高可提升 31% 成功率。这意味着:
- 降低人工干预成本:高成功率减少传送带停机、人工错误处理和重试,直接提升拣选节拍。
- 扩大自动化边界:不依赖结构化环境,可部署到更多未预先整理的作业场景,提高机器人 ROI。
- 快速落地:方法保持 DP3 扩散 backbone 不变,仅增加条件输入,迁移成本低,适合现有 3D 扩散策略用户的增量升级。
与现有产品/工作流集成
该方法可无缝嵌入现有 ROS/ROS2 机器人软件栈。集成路径:
- 使用已标定的 RGB-D 相机 获取 RGB 图像与点云。
- 运行开放词汇分割模型(如 Grounding DINO + SAM)对 RGB 进行目标掩码预测。
- 通过相机几何将 2D 掩码提升到 3D,生成 三场注意力特征(
targetness、intra-target saliency、backgroundness)。 - 将特征作为额外条件输入到已有的 DP3 扩散策略中。
无需重训整个策略,可作为 PLUGIN 模块接入。注意推理延迟:论文消融显示三场编码开销低,但分割模型是主要瓶颈,建议部署时使用轻量级开放词汇分割或缓存目标特征。代码已开源(GitHub),但 star 数仅 9,工业落地需自行验证稳定性与泛化性。
局限
- 该方法的核心前提是获得准确的**2D 目标掩码**,这依赖于开放词汇分割模型(如 GroundingDINO / SAM)的性能。在严重遮挡、极端光照或纹理稀疏的场景中,分割可能产生漏检或错误边界,导致提升到 3D 后构造的 **targetness / intra-target saliency / backgroundness** 场出现偏差。虽然论文中进行了对不完美 2D 感知的鲁棒性实验,但实验设置可能有限,实际部署中分割质量的波动仍是一个潜在风险。
- 与原始 **DP3** 相比,**Attention-DP3** 在推理阶段增加了 2D 分割、相机几何提升和 Tri-field 编码等步骤,带来了额外的计算开销和延迟。论文虽然报告了推理延迟数据,但未与 DP3 进行严格的延迟对比,也未在资源受限的实时控制场景(如高频闭环控制)中验证可行性。对于对延迟敏感的机器人操作任务,这些额外模块可能限制其实用性。
- **Attention-DP3** 保持 DP3 扩散主干不变,仅通过条件注入来增强策略,因此其性能上限仍受 DP3 架构能力的制约。在面对需要长时程规划、复杂接触推理或动态环境交互的任务时,单纯的条件增强可能不足以克服 DP3 在表示能力和时序建模上的固有局限。此外,实验主要限于静态抓取/放置类任务,未展示在更复杂的多阶段操作或移动操作中的表现。