论文

Android GUI 智能体对运行时异常是否鲁棒?AnTrap:在动态对抗环境中评估智能体

Android GUI 智能体对运行时异常是否鲁棒?AnTrap:在动态对抗环境中评估智能体

GUI 智能体在 Android 设备上部署时经常遭遇动态异常,从意外弹窗到操作误用,然而现有基准缺乏对智能体在运行时异常下鲁棒性的系统评估。为此,我们提出 AnTrap,一个注入动态扰动的综合基准,用于评测智能体执行轨迹中的异常场景。 我们提出了一套分类法,将真实世界异常组织为四个层面(State、Thinking、Action、Round)和十个细粒度子类,并开发了相应的构建流水线,在保持任务可解性的同时引入真实对抗条件。通过评估 16 个主流 GUI 模型,我们发现智能体对动态异常普遍脆弱,即使最强模型也出现显著性能下降。 进一步,我们在原始环境和对抗环境中进行 GRPO 训练来验证基准,区分出环境可学习异常与推理瓶颈异常。结果表明:单步陷阱(如状态层和动作层)在很大程度上可通过对抗强化学习解决;而深层上下文陷阱(如 state deadlock)则暴露出内在局限,仅靠含陷阱的环境训练无法克服。

论文精读

TL;DR AnTrap 基准系统注入运行时动态异常,覆盖四层十类陷阱,评估 16 个 GUI 模型后揭示普遍脆弱,并区分可训练与推理瓶颈。

问题

问题背景

当前 GUI agent 在 Android 设备自动化任务上进展迅速,但真实部署中频繁遭遇运行时异常(如突发弹窗、误触发操作),模型鲁棒性成为能否落地的关键瓶颈。

现有方法局限

现有 benchmark 主要评估静态任务完成率,对动态干扰的系统建模不足:

  • 异常注入方式单一,多为固定弹窗或随机噪声,缺少对 State / Thinking / Action / Round 多层陷阱的覆盖;
  • 缺少细粒度分类法,难以区分不同异常对推理链的具体影响,也无法判断失败源于环境扰动还是模型固有局限;
  • 部分基准为保证任务可解而人为剔除干扰,导致评测分布与真实 Android 部署严重偏移。

为什么这个问题难/重要

动态异常具有时序依赖与状态复杂性:模型必须在部分观测下判断当前屏幕是否属于任务关键路径、是否需要绕过陷阱,这对多步规划与视觉理解提出极高要求。AnTrap 引入 可解但含对抗干扰的执行轨迹,评估 16 个主流模型后揭示普遍脆弱性;进一步 GRPO 训练显示,单步陷阱可通过在对抗环境中强化学习缓解,而 state deadlock 等深层上下文陷阱暴露了不可通过环境交互补足的推理极限。这一区分对实际工程至关重要:若仅靠扩大环境多样性无法解决认知短板,则需重新审视模型架构与推理机制,而非盲目增加训练数据。

行业类比

类似自动驾驶对 corner case 与 adversarial scenario 的系统化测试,GUI agent 需要专门的“陷阱注入”基准来暴露真实部署中的脆弱点。

核心洞察

  • **AnTrap** 系统性地将运行时异常注入 Android GUI agent 执行轨迹,并保持任务可解性,构建了对抗性动态基准。与现有静态 GUI 基准仅评估干净指令下的任务成功率不同,它还原了真实部署中的弹窗、动作误用等干扰,迫使模型暴露在环境扰动下的鲁棒性缺陷,为衡量 agent 部署可靠性提供了更贴近现实的测试尺度。
  • GRPO 训练对比实验揭示了两类异常的可分离性:状态层 / 动作层的单步陷阱通过对抗性强化学习可有效缓解,而状态死锁等深层上下文陷阱即使训练后仍难以解决,指向模型固有推理瓶颈。这种二分法说明仅靠环境探索与策略优化无法弥补推理层面的缺陷,为后续鲁棒性改进指明了架构级或推理增强的方向。
  • 四层分类法(State / Thinking / Action / Round)将动态异常解耦至 agent 执行的不同阶段,实现细粒度脆弱性诊断。相比以往笼统的异常测试,该框架能定位模型失效的具体层级,例如区分感知类单步陷阱与上下文理解类陷阱,从而指导开发者定向优化数据合成、训练策略或推理流程,提高调优资源投入的针对性。

方法

AnTrap 以原始 Android GUI 任务及其正常执行轨迹为输入,构建动态对抗评估环境。核心模块包括:

  • 异常分类体系:将真实运行时异常组织为 State、Thinking、Action、Round 四层,共十个细粒度子类,覆盖 unexpected pop-ups、action misuse、state deadlock 等场景。
  • 动态陷阱注入 pipeline:在 agent 执行轨迹上标记干预点(intervention points),通过触发机制(trigger mechanism)与历史策略(history policy)动态插入陷阱;每一处注入都保持原始任务的可解性,避免生成无解任务。
  • 对抗性训练验证:在 AnTrap 环境与原始环境上分别进行 GRPO 强化学习训练,比较模型在 original tasks 和 adversarial tasks 上的 step success rate 与 task success rate,分离 environment-learnable anomalies 与 reasoning-bottlenecked anomalies。

输出为 AnTrap 基准及模型鲁棒性诊断:单步陷阱(state/action 层)可通过对抗 RL 缓解,而深度上下文陷阱(如 state deadlock)暴露内在推理瓶颈。与仅做静态障碍注入或离轨测试的基准不同,AnTrap 在运行轨迹上动态注入陷阱并严格保持任务可解性,更贴近真实部署中的对抗异常。

实验

实验设计

论文构建 AnTrap 基准,将真实运行时异常归纳为四层(State / Thinking / Action / Round)十子类,注入到原始 Android GUI 任务执行轨迹中,同时保持任务可解性。实验评估 16 个主流 GUI 代理模型,分别在原始任务集和注入陷阱后的对抗任务集上测试,量化成功率下降幅度。此外,作者在原始环境与 AnTrap 对抗环境中分别进行 GRPO 强化学习训练,对比模型在两类任务上的表现,以区分可通过环境学习解决的异常与推理瓶颈异常。

关键发现

所有被测模型对动态异常普遍脆弱,即使最强模型也出现显著性能下滑。模型在上下文相关陷阱(如状态死锁)上的表现远差于单层陷阱,表明现有基准低估了真实部署风险。实验结果还显示,推理能力(如常规任务准确率)并不等同于鲁棒性,部分通用推理强的模型在特定陷阱上同样失分严重。通过 GRPO 在对抗环境训练,状态层与动作层的单步陷阱可被有效缓解,但像 state deadlock 这类深度上下文陷阱仍无法通过仅增加环境陷阱来完全克服,反映了模型推理能力的内在限制。

与基线对比解读

与直接在原始环境评估的基线相比,AnTrap 暴露了动态异常下的性能坍缩,说明仅靠静态、无扰动的基准难以指导实际部署。在原环境进行 GRPO 训练的模型,转移到对抗环境时鲁棒性提升有限;而在 AnTrap 环境训练的模型,在部分陷阱类型上有所改善,但仍存在不可逾越的推理瓶颈。该对比清晰地将鲁棒性问题分解为环境可学习异常与推理瓶颈异常,提示后续工作除了增强训练环境多样性,还需从模型推理机制、记忆或规划层面进行针对性改进。

行业影响

落地场景

AnTrap 可作为 移动端 GUI 代理 的鲁棒性测试与训练环境,直接应用于 RPA 流程自动化、智能助手、电商自动化运营 等产品。例如电商自动下单代理需处理弹窗、按钮失效、页面跳转等运行时异常;企业服务中的自动报销代理需应对表单字段变化、系统提示。其 四层陷阱分类(State, Thinking, Action, Round)与 十子类 可系统评估代理在真实对抗环境下的可靠性。

商业价值

降低 GUI 代理真实部署的 故障率,减少人工介入与监控成本;提升自动化任务成功率,直接改善用户体验和业务转化。论文发现 单步陷阱可通过 GRPO 训练显著解决,而 state deadlock 等深层陷阱暴露推理瓶颈,这为模型迭代提供清晰优先级,避免在环境可学习缺陷上过度投入,将训练资源聚焦于推理能力提升。

与现有工作流集成

AnTrap 可集成到 MLOps 流水线:作为模型发布前的鲁棒性门禁,每次模型更新在 AnTrap 对抗集回归;也可作为 强化学习环境 用于 GRPO 微调。其陷阱注入逻辑可封装为 Appium/Selenium 插件,或集成到 LangChain 等 agent 框架的评估模块,扩展 Web/桌面场景。

具体 use case:

  • 电商平台:自动优惠券领取代理,注入“虚假弹窗”和“按钮拦截”陷阱,评估能否跳过干扰完成任务,降低因异常导致的订单流失。
  • 企业服务 RPA:财务自动对账机器人,利用 State 层陷阱 模拟表格字段错位、死锁状态,验证代理是否陷入死循环,减少人工查账负担。

局限

  • **数据覆盖有限**:AnTrap 中的动态陷阱虽源于真实世界异常分类法,但注入过程依赖人工设计与验证,其分布可能与真实用户遭遇的异常存在偏差;任务可解性经过人工核验,但难以完全排除个别不可解任务。基准目前仅针对 Android 平台构建,对 iOS、桌面 GUI 或 Web 界面的泛化性尚未验证。
  • **实验范围受限**:评估的 16 个模型以闭源 API 模型为主(如 GPT-4o、Gemini 等),对开源小模型或本地部署模型的覆盖不足,可能低估了不同规模模型的鲁棒性差异。GRPO 训练仅在部分任务子集和固定超参数下进行,结论可能不适用于其他强化学习算法或更广泛的配置。
  • **评估导向明显**:与 AndroidArena、MobileAgentBench 等 GUI agent 基准相比,AnTrap 侧重于对抗性异常注入,但缺少对 agent 在长时间自主运行中状态累积漂移的建模;同时该工作主要提供评估工具和初步 GRPO 实验,未提出具体的防御策略或架构改进,对如何从根本提升推理层鲁棒性仍留白。
论文Guo Gan2026-08-25原文

相关内容