BadWAM: 当世界动作模型想象正确但行动错误
世界动作模型 (WAMs) 正成为具身控制的基础:它们不仅预测动作,还学习耦合动作生成与未来世界预测的表征。这种耦合通常被认为能增强鲁棒性、可解释性和安全性,因为原则上机器人的动作可与其想象的未来进行对比。然而,本文表明这一假设是脆弱的。 我们提出 BadWAM,一个统一框架,用于建模和评估 世界动作漂移攻击:一类新的针对 WAM 的对抗攻击,使用微小视觉扰动破坏模型想象与执行之间的对齐。BadWAM 沿两个标准刻画攻击面:攻击强度与隐蔽性。当攻击者优先考虑破坏时,BadWAM 实例化 动作唯一对抗攻击,直接驱使模型执行导致任务失败的动作。当攻击者额外考虑隐蔽性时,BadWAM 实例化 想象保持对抗攻击,旨在诱使有害的动作偏移,同时让模型预测的未来接近其干净的想象。 这两种攻击覆盖了从公开动作劫持到更隐蔽的情况——模型看似想象合理的未来,却执行了失同步的动作。我们在不同 WAM 变体上评估 BadWAM。结果表明,在闭环执行下,我们的攻击显著降低了任务成功率。例如,动作唯一攻击将模型性能从 96.5% 降至 43.1%。想象保持攻击进一步暴露了 WAM 特有漏洞:适度的未来保持正则化能在保持强攻击性能的同时减少未来想象漂移。
论文精读
TL;DR BadWAM 揭示世界-行动模型 (WAM) 的脆弱性:通过微小视觉扰动即可制造“想象正确、执行错误”的漂移攻击,大幅降低闭环任务成功率,暴露了耦合预测并非安全保证。
问题
具身智能领域,世界-动作模型(WAM) 正成为构建通用机器人控制系统的关键基础。这类模型不仅预测动作,还同时生成对未来的视觉想象,从而实现动作与预测的耦合。这种耦合被视为提升鲁棒性、可解释性与安全性的重要设计——机器人的动作在原则上可与其想象结果进行核对。
然而,现有的对抗攻击研究主要针对纯动作模型或视觉感知模型,忽略了 WAM 特有的“动作-想象对齐”漏洞。传统攻击方法假设攻击目标单一(例如欺骗分类器或轨迹预测),而 WAM 中,攻击者可以利用预测与执行之间的错位,制造“想象正确但执行错误”的隐蔽失效。缺乏针对这种耦合机制的专用攻击框架,导致该安全评估维度长期空白。
这一漏洞之所以难以应对且危害显著,在于攻击者必须同时实现两个相互制约的目标:大幅偏移动作以导致任务失败,同时尽量保持所预测的未来视觉状态与正常状态接近,以绕过监控检测。成功利用此漏洞可让机器人在看似正常的监控下执行危险动作,直接挑战了WAM 作为安全基石的假设。随着 WAM 在自动驾驶、人形机器人等高安全需求场景中的应用加速,这类世界-动作漂移攻击的潜在后果极其严重,亟需系统性的评估与防御。
这一风险类似于自动驾驶中针对多任务模型的对抗样本攻击:微小视觉扰动使决策模块输出危险路径,而感知预测仍显示为安全场景,形成监控盲区。
核心洞察
- 世界-行动模型(WAM)的“想象检查行动”安全范式存在根本缺陷:BadWAM 证明,通过在视觉输入上施加微小扰动,可以导致行动严重偏离预期,而模型对未来状态的预测(想象)几乎不变。这与以往攻击仅关注行动或仅关注感知的对抗样本不同,它直接破坏了 WAM 特有的耦合机制,表明依赖想象验证可能造成虚假安全感。
- BadWAM 提供的攻击可调性(强度与隐蔽性)暴露了 WAM 安全评估的新维度:攻击者可以根据场景选择完全破坏任务(action-only)或保持想象干净的同时误导行动(imagination-preserving)。这种隐蔽攻击尤其危险,因为想象仍看似合理,但机器人执行了不同的动作,传统异常检测难以发现。这为安全防护设计提出了新挑战:必须同时监测行动与想象的同步性,而非单独检查未来状态。
方法
BadWAM 攻击框架
输入:一个预训练的 World-Action Model (WAM),接收从环境获取的视觉观测 (o_t),输出当前动作 (a_t) 及对未来的想象表征 (z_{t+1})。攻击者在每个时间步向 (o_t) 添加一个 (\ell_\infty) 范数约束下的微小扰动 (\delta_t),不访问模型内部参数(黑盒威胁模型)。
关键模块:双目标对抗优化
BadWAM 的核心是一个统一的双目标损失函数,由两项组成:
- 动作偏离损失 (L_{act}):最大化扰动后动作与专家/正确轨迹的动作差异,直接驱动模型输出错误行动。
- 想象保持损失 (L_{img}):最小化扰动后想象未来与干净观测下想象未来的距离,维持“想象合理”的假象。
通过调节两项损失的权重,实例化两种攻击模式:
- Action-Only Attack(动作劫持):(L_{img}) 权重为 (0),仅优化 (L_{act})。生成的动作明显偏离正确路径,任务成功率遭到大幅压制。
- Imagination-Preserving Attack(想象保持攻击):同时优化 (L_{act}) 与 (L_{img}),在保证想象未来与干净情况相近的条件下,悄悄引导动作走向错误。实现动作-想象漂移,即模型“梦见”正确未来,却执行了错误动作。
查询式在线优化
攻击采用黑盒查询驱动策略(例如零阶梯度估计或进化搜索),在闭环执行过程中逐帧求解扰动。每一轮迭代通过多次查询模型,评估组合损失并更新 (\delta_t),之后将其投影回容许扰动球内。该在线优化方式确保攻击能适应动态环境。
输出与效果
最终输出一系列对抗观测,在闭环控制下显著降低任务成功率(如从 96.5% 降至 43.1%)。想象保持攻击还额外暴露了 WAM 特有的脆弱性——模型想象与执行的不对齐。
与同类方法的差异:传统对抗攻击聚焦于单步预测(分类或简单回归),BadWAM 首次系统性地利用 WAM 的动作-世界耦合特性,展现了“想象正确”不等于“行动安全”这一全新攻击面,为具身智能的安全评估提供了独特测试视角。
实验
实验设计
本文在多种 WAM 变体上评估 BadWAM 攻击框架,涵盖动作驱动攻击(action-only attack)与想象保持攻击(imagination-preserving attack)。攻击在闭环环境中执行:每一时间步,攻击者根据当前观测生成微小视觉扰动,诱导模型输出错误动作,并持续至任务完成。评估指标包括任务成功率、未来想象漂移量以及攻击隐蔽性。实验还考察了攻击可迁移性和非自适应防御效果。
关键发现
- 攻击有效性:仅作用于动作的攻击使成功率从 96.5% 骤降至 43.1%,证明 WAM 的动作-想象对齐极易被破坏。
- 隐蔽攻击暴露深层脆弱性:想象保持攻击在 维持未来预测与干净想象高度一致 的同时,仍能大幅降低任务成功率,说明模型即使“梦得对”,也可能“做得错”。
- 系统性与可迁移性:故障在不同任务组和试次间高度一致,且攻击可由一个 WAM 变体迁移至其他变体,显示该脆弱性是 WAM 设计范式共有的。
- 防御困难:简单的输入滤波或异常检测无法有效抵御此类攻击,因为扰动符合自然图像分布且不强烈扭曲未来想象。
与基线的深度对比
相比纯粹的动作对抗攻击(只关注最大化动作偏差),BadWAM 的想象保持攻击首次揭示了 WAM 中行动-想象解耦的根本弱点。传统攻击可能引起未来预测严重失真而容易被监测,但 BadWAM 的隐蔽变体让安全监控机制(如根据想象未来拒绝危险动作)形同虚设。与随机扰动基线相比,精心设计的扰动不仅更高效,而且成功率提升数倍,表明攻击利用了模型内部的联合表示缺陷,而非简单的感知破坏。
行业影响
落地场景
BadWAM 揭露的漏洞直接威胁所有依赖 世界-行动模型 (WAM) 的具身智能系统。典型场景包括:
- 工业与服务机器人:在动态环境中执行抓取、组装、导航任务。攻击者可通过不易察觉的标签、光照或屏幕闪烁,诱导机器人产生安全动作假象,实则发生碰撞或误操作。
- 自动驾驶与高级辅助驾驶 (ADAS):若规划模块采用世界模型预测未来轨迹,攻击者可能在摄像头或雷达信号中注入微小扰动,使车辆在“想象正常”的情况下执行危险转向或急刹。
- 无人机与监控系统:基于视觉的自主巡逻、目标跟踪中,扰动可令无人机偏离航线但保持悬停假象,不易被察觉。
商业价值
该研究直接指向 安全投入的优先级:
- 降本:提前暴露 WAM 脆弱性,比安全事故后的补救成本低数个量级。可用于自动化渗透测试,减少人工红队测试费用。
- 增收/体验提升:通过鲁棒性认证,机器人或自动驾驶产品的安全评级提升,可转化为招标优势或保险折扣。集成 BadWAM 作为持续验证工具,有利于通过法规审核。
- 新型安全服务:第三方安全公司可开发基于 BadWAM 的评测套件,为具身智能厂商提供漏洞扫描与加固服务,开辟新的收入流。
与现有产品/工作流的接口
BadWAM 作为 查询式 (query-based) 黑盒攻击框架,可直接嵌入现有的 CI/CD 与安全测试流水线:
- 在模型发布前,将其作为自动化测试桩,对每一版 WAM 模型生成对抗样本,测量闭环任务成功率与想象漂移指标。
- 可与数据飞轮结合:将攻击成功样本加入训练集,通过对抗训练提升鲁棒性,形成“攻击-训练-再测试”的闭环。
- 对已部署系统,可定期运行 BadWAM 以检测更新后的脆弱性,与监控系统联动告警。
具体落地 Use Case
电商仓储机器人
大型履约中心中的视觉抓取机器人普遍依赖预测下一帧以优化动作。攻击者可在货箱表面印制几乎不可见的图案,BadWAM 可模拟此类物理攻击,导致机器人反复掉落物品但视觉预测显示正常。安全团队可据此加固感知模块,或增加多模态异常检测。Robotaxi 安全测试
自动驾驶公司采用端到端世界模型进行规划。在封闭场地测试中,用 BadWAM 生成对抗性视觉输入(如投影到前车尾部的干扰),验证车辆是否会异常变道,同时检查内部世界模型的预测是否出现“想象与实际”不一致,从而在量产前堵住漏洞。
局限
- **评估范围受限**:实验主要在仿真环境(如 LIBERO, RoboCasa)和特定 WAM 变体上进行,未在真实机器人硬件上验证。仿真中的视觉扰动效应、物理交互与真实世界存在差异,攻击在现实部署中的可迁移性尚未得到验证,限制了结论的普适性。
- **攻击成本与查询效率**:BadWAM 依赖基于查询的在线优化,每次扰动需要多次模型前向推断,且扰动预算(perturbation budget)需按步长仔细调节。文中提及攻击成功率高度依赖于查询次数,实际黑盒场景下模型访问受限时,攻击收敛速度和成功率可能显著下降,未提供高效替代方案。
- **防御手段分析较浅**:论文仅简要探讨了非自适应防御(如图像预处理、随机噪声),这些方法难以应对精心设计的攻击。缺乏对 WAM 架构层面的防御(如想象 - 执行一致性强制、鲁棒训练)的深入讨论,未能给出实用的防御指南。