DRIFT: 通过对抗补丁攻击使 Flow-Matching VLAs 的去噪轨迹偏离
Flow-matching 视觉-语言-动作(VLA)模型如 pi0 通过积分学习的去噪速度场生成机器人动作,据报道能抵抗轻易欺骗自回归 VLA 的对抗扰动。我们表明这种鲁棒性在很大程度上是虚幻的:它源于先前的攻击忽略了多步去噪 ODE。 我们提出 DRIFT(Denoising Redirection via Input perturbation of the Flow-matching Trajectory),一种测试时通用对抗补丁,放置在机器人夹爪上,攻击现成策略的去噪速度场。核心发现是反直觉的:仅攻击第一步去噪 比攻击更宽的步骤窗口更强且更便宜,这归因于输入空间优化中特有的梯度冲突,与训练时后门机制完全相反。 在 pi0 和 pi0.5 上,跨四个 LIBERO 套件,DRIFT 用单个小补丁几乎破坏所有原本可解决的任务,远超动作空间和嵌入空间攻击基线。
论文精读
TL;DR DRIFT 通过对抗补丁攻击流匹配 VLA 的首个去噪步,以更低成本彻底破坏机器人任务,揭示了所谓鲁棒性实为假象。
问题
问题背景
随着视觉-语言-动作(VLA)模型成为通用机器人控制的主流范式,特别是基于流匹配的 π0 系列,其安全性备受关注。前期报告称这类模型对对抗扰动有一定鲁棒性,但真实脆弱性尚不清晰。
现有方法局限
先前的攻击手段主要针对自回归式 VLA,它们直接扰动最终动作或中间嵌入,而未考虑流匹配模型的多步去噪 ODE 过程。这使得攻击在流匹配 VLA 上成功率极低,给人以“模型鲁棒”的错觉。实际上,早期攻击忽略了去噪轨迹中不同步骤的梯度特征:对去噪全程或大窗口进行攻击时,不同步间的梯度会发生冲突,削弱攻击效果。这种冲突在训练时反向利用(如后门植入)可奏效,但在输入空间优化时却成为阻碍,造成攻击窗口越宽、干扰力度反而越弱的反直觉现象。
为什么这个问题难/重要
流匹配 VLA 的动作生成依赖连续时间的常微分方程求解器,攻击者必须在高维输入空间中找到能破坏整条轨迹的扰动,而仅允许修改机器人夹具上的一个局部补丁。技术难点在于:1)去噪初期对最终动作有级联放大效应,攻击需精准针对最早的去噪步;2)通用补丁需跨任务、跨场景迁移,对优化稳定性要求极高;3)实际部署中攻击者对模型梯度访问有限,需在黑盒或灰盒条件下有效。随着 π0 等模型被集成到真实机器人系统,此类攻击一旦被利用,会导致机器人产生错误的抓取动作(如幻象抓取),造成物理破坏,因而安全性研究在产业界高度关注。
行业类比
如同自动驾驶中贴在路标上的对抗补丁可误导目标检测,在机器人夹具上贴小补丁就能使先进操作模型全线失效,揭示了感知-行动耦合系统的共性脆弱面。
核心洞察
- 攻击流匹配 VLA 的去噪轨迹时,仅优化第一个去噪步骤的对抗扰动,效果反而优于攻击多个步骤。这是因为输入空间的梯度优化存在独特的冲突:后续步骤的梯度会抵消早期步骤的扰动方向,导致多步攻击的更新信号相互干扰,最终降低攻击强度。此现象与训练阶段的后门攻击行为完全相反,揭示了推理时攻击的全新特性。
- 此前认为流匹配 VLA(如 π0)比自回归 VLA 更鲁棒,但 DRIFT 显示这种鲁棒性很大程度上是假象——过去的攻击方法忽略了去噪 ODE 的多步特性,仅模仿了针对单步预测的攻击。通过在物理世界可实现的夹爪对抗补丁,DRIFT 首次系统性破坏了流匹配策略的完整去噪链,使原本可解的任务几乎全部失败,远超动作空间和嵌入空间攻击基线。
方法
输入与扰动建模
DRIFT 将攻击建模为在机器人夹爪上放置一个对抗补丁(adversarial patch),通过相机观测进入 VLA 的视觉输入。补丁仅占据图像局部区域,在物理部署中易于实现,且属于测试时通用攻击(universal attack),即同一补丁可瘫痪模型在多个任务上的表现。
核心模块:攻击流匹配去噪速度场
流匹配 VLA(如 π0、π0.5)通过学习一个去噪速度场(denoising velocity field),从随机噪声出发沿 ODE 轨迹逐步积分生成动作。DRIFT 的关键洞察是:现有攻击忽略了这个多步去噪过程,错误地假定一次性扰动即可奏效。
DRIFT 直接优化补丁,使去噪速度场在推理轨迹上产生系统性偏移。具体而言,攻击目标为最大化任务动作的预测误差(如与真实动作的均方误差),优化过程使用 PGD(projected gradient descent)在速度场上计算梯度,但仅针对第一个去噪步骤进行扰动优化。
反直觉策略:少步攻击更强
实验发现,攻击更多去噪步骤(如全部 10 步)反而导致攻击效果下降。原因在于输入空间优化的梯度冲突:不同去噪步骤对补丁的梯度方向可能相互抵消,而仅优化第一步能最大程度操纵整个轨迹——早期偏差在后续积分中被不断放大,形成“级联效应”。这与训练时通过操控多个步骤注入后门的攻击范式截然相反。
输出与效果
被攻击后的 VLA 输出连续的错误动作序列,典型失败模式如“phantom grasp”(夹爪在未接触物体时做出抓取动作),导致任务完全失败。在 LIBERO 四个任务套件上,单个小补丁即可破坏几乎全部原本可解的任务,远超动作空间或嵌入空间攻击基线。
与同类方法的差异
不同于针对自回归 VLA 的逐词攻击,DRIFT 首次揭示了流匹配 VLA 去噪动力学中对第一步的极端脆弱性,将攻击从对抗生成范式转向轨迹重定向范式。
实验
实验设计
实验在四个 LIBERO 套件(Goal, Object, Spatial, Long)上评估 DRIFT 攻击。受害者模型为预训练的流匹配 VLA 模型 π0 和 π0.5。攻击者将一个通用对抗补丁(universal adversarial patch)贴在机器人夹具上,通过 PGD 优化输入扰动,以偏离去噪速度场。攻击针对不同去噪步骤窗口进行消融,并与动作空间攻击(Action-space)和嵌入空间攻击(Embedding-space)基线对比。评估指标为任务成功率及扰动预算下的攻击鲁棒性。
关键发现
- 虚假的鲁棒性:之前认为流匹配 VLA 对对抗扰动具有鲁棒性,原因是攻击忽略了多步去噪 ODE;DRIFT 揭露了该虚假性。
- 反直觉现象:仅攻击第一个去噪步骤比攻击更宽的窗口更强且更经济,这是输入空间优化中特有的梯度冲突所致,与训练时后门行为截然相反。
- 灾难性失败:小型补丁即可破坏几乎所有原本可解的任务,并引发“幻觉抓取”(phantom grasp)——模型错误地想象抓取物体。
- 跨模型迁移:DRIFT 补丁具有一定的跨模型迁移能力,且简单防御如 JPEG 压缩效果有限。
基线对比解读
动作空间和嵌入空间攻击直接修改动作或隐藏向量,但难以从根本上改变整个去噪轨迹,尤其当初始视觉输入未被污染时。DRIFT 选择从输入空间发起攻击,扰动视觉 token 进而影响所有去噪步骤。实验表明 DRIFT 远超基线,证明针对流匹配 VLA 的对抗攻击必须考虑其多步生成特性。只攻击第一步的策略高效且强大,这对设计防御机制有启示:需重点保护初始去噪步骤的输入编码。
行业影响
落地场景
DRIFT 攻击方法可直接用于机器人安全测试与鲁棒性评估,尤其适用于基于 流匹配 VLA 模型(如 π₀、π₀.₅)的自主操作场景:物流分拣、家庭服务、医疗辅助等。安全团队可将 DRIFT 生成的小块通用对抗补丁贴在机器人夹爪上,在仿真或真实环境中暴露模型的脆弱性(如虚假抓取),在部署前发现潜在失效模式。
商业价值
- 风险规避:部署前通过对抗测试降低机器人因物理攻击导致的任务失败或设备损坏风险,减少维护与保险成本。
- 安全认证:作为第三方安全评估工具,为机器人系统提供鲁棒性认证,增强客户与监管机构信任,形成新的合规服务市场。
- 防御驱动:催生对抗训练与轻量级防御模块的商业需求,例如基于 JPEG 压缩 的输入预处理,为安全厂商开辟产品线。
与现有产品/工作流的接口
DRIFT 可无缝嵌入 VLA 开发运维流水线:
- 模型验证阶段:集成补丁优化器,自动生成攻击样本并报告任务成功率下降幅度。
- 持续集成 (CI):将对抗测试加入自动化测试套件,每次模型更新时评估鲁棒性变化。
- 运行时防御:提供轻量插件对相机输入做实时异常检测或特征压缩,拦截攻击。
具体落地用例
- 电商仓储机器人:某国际电商的自动拣选系统采用 π₀ 模型控制机械臂。部署前利用 DRIFT 在仿真中对夹爪贴片进行百万次抓取测试,发现原本可解的任务成功率骤降至 < 10%,促使架构调整与对抗训练,避免现场事故。
- 手术辅助机器人:手术机器人依赖 VLA 完成精细操作,攻击者可能通过物理贴纸干扰动作。安全审计公司使用 DRIFT 评估模型脆弱性,为制造商提供加固方案,预防医疗事故并满足医疗器械安全审核要求。
局限
- **物理可实施性受限**:DRIFT 假设对抗补丁贴在机器人夹爪上且始终可见,但真实操作中夹爪可能被环境遮挡,或补丁因形变、光照变化而失效。此外,补丁需要针对每个模型和相机视角单独优化,未验证对动态视角的鲁棒性,实际部署时泛化能力存疑。
- **白盒威胁模型依赖**:方法需完整访问 flow-matching VLA 的去噪速度场梯度,属于白盒攻击。黑盒场景下(如仅能查询输出动作)或模型权重不可得时,攻击有效性大幅下降。论文仅在 π₀ 和 π₀.₅ 上验证,对其他 flow-matching 架构(如扩散策略)的迁移能力未经充分测试,跨模型泛化性不足。
- **防御措施探索有限**:论文仅测试了简单的 JPEG 压缩防御,未探讨对抗训练、梯度掩蔽、输入变换等常用防御手段的效果。且攻击目标为纯破坏性(使任务完全失败),未研究更隐蔽的攻击(如诱导特定错误动作),这限制了其在安全评估中的实用性,也忽略了攻防博弈下可能的模型演进。