AgentHijack:基准测试计算机使用智能体对常见环境干扰的鲁棒性
基于多模态大语言模型(MLLM)的自主计算机使用智能体正逐渐成为完成复杂数字工作流的得力助手。然而,现实执行环境远非理想:弹窗、分辨率变化和竞争性应用频繁干扰智能体的感知与控制。 本文引入 AgentHijack 基准,用于评估计算机使用智能体在常见环境干扰下的鲁棒性。该基准通过 9 种可配置的常见干扰(如弹窗、分辨率变化等)模拟现实中的不完美场景。实验发现,即使是微小的干扰也会导致性能显著下降,凸显了智能体的脆弱性及鲁棒性评估的必要性。 针对此问题,我们提出 AgentHijack-Agent 框架,包含增强接地能力(grounding)的动作生成器(action generator)和一个负责行为总结与环境检查的旁观者(onlooker)。大量实验验证了其有效性。代码、环境、基线模型及数据已公开。
论文精读
TL;DR AgentHijack 基准揭示 MLLM 驱动的计算机使用代理在弹窗、分辨率变化等常见干扰下极易失效,并推出集成动作生成与旁观者检查的增强框架来提升鲁棒性。
问题
领域背景
近年,基于多模态大语言模型(Multimodal Large Language Models, MLLMs)的计算机使用代理(computer-use agents)快速发展,能够自主执行复杂的桌面任务流,在自动化办公、软件测试等领域展现出巨大潜力。
现有方法的局限
当前评测基准(如 OSWorld)主要关注理想环境下的端到端任务成功率,忽视了真实执行环境中无处不在的非对抗性环境扰动——例如软件更新弹窗、屏幕分辨率变化、并发进程抢占焦点等。这些干扰并非恶意攻击,而是动态系统运行的常态。现有代理框架大多缺乏对屏幕状态的鲁棒感知与主动环境检查机制:视觉编码器对遮挡、缩放等变化敏感,规划模块未将环境不确定性纳入工作流,导致一次界面异常就会引发动作链崩溃或错误累积。此外,代理通常缺乏对自身行为历史的总结与反思能力,难以从意外中断中恢复。
难度与重要性
计算机使用代理的工作环境是高度动态的图形用户界面,其开放性与不确定性远超封闭的 API 交互。保证代理在各类常见干扰下仍能稳定完成任务,不仅需要更强的视觉接地(grounding)能力,还需要对行为历史进行总结并实时监控环境状态,这涉及感知、规划、校验的多重耦合,技术挑战显著。随着 MLLM 能力的提升,业界对代理的自动化水平期望持续升高,但鲁棒性瓶颈已成为其走向生产级应用的最大障碍——即便单任务成功率高达 90%,一旦面对真实场景中 10% 的干扰概率,整体可用性将急剧下降。
行业类比
正如自动驾驶系统必须应对雨天、逆光等非理想路况,计算机使用代理也需适应桌面环境的“气候”变化——弹窗、分辨率变化等犹如数字世界的天气现象,鲁棒性是代理走向大规模商用的关键门槛。
核心洞察
- **真实环境扰动对 MLLM 代理的鲁棒性威胁被严重低估**:现有基准多在理想干净桌面中测试,AgentHijack 首次系统引入 9 种可配置的常见干扰(弹窗、分辨率变化、应用抢占焦点等),量化评估大量基线代理后发现,即使轻微干扰也能导致成功率断崖式下跌。这表明当前计算机使用代理的感知-控制链高度脆弱,在缺少鲁棒性评估的流水线下直接部署风险巨大,为工程落地敲响警钟。
- **AgentHijack-Agent 通过轻量级“观察-摘要”机制替代重规划增强抗干扰能力**:不同于常见的反思或重试策略,该框架在动作生成器外增设 onlooker 模块,持续监测环境状态并总结行为,当干扰发生时能够快速进行上下文检查和调整,避免陷入重复失败或高昂的重规划成本。实验证明,这种解耦的设计在不显著增加推理开销的前提下显著提升了代理在扰动环境中的任务完成率,为构建鲁棒桌面 agent 提供了可复用的范式。
方法
输入与任务设定
Agent 接收桌面截图(来自 OSWorld 环境,见附录 A)与自然语言任务指令,需在存在常见环境干扰(弹窗、分辨率突变、竞争应用等)的条件下完成工作流。
核心模块
- 动作生成器(Action Generator):基于 MLLM,采用 增强的接地能力(enhanced grounding capabilities) ——即不仅依赖语言描述,还通过视觉定位或屏幕坐标对齐来精确识别可交互元素。它将当前观察与任务上下文映射为具体操作(点击、输入、滚动等),输出标准化的动作空间定义。
- 旁观者(Onlooker):一个附加监控模块,执行两项功能:
- 行为总结(Behavior Summarization):从连续动作序列中提取关键进展,保持长程任务上下文的连贯性。
- 环境检查(Environment Checking):实时分析屏幕状态,检测异常干扰(如非预期弹窗、界面跳转),并向动作生成器反馈状态提示或重规划信号。
工作流
- 旁观者首先总结历史行为并检查当前环境状态。
- 动作生成器结合总结信息、检查结果、任务指令及最新截图,生成下一步动作。
- 重复直至任务完成或触发终止条件。
与同类方法的差异
与直接通过 MLLM 端到端输出动作的 Agent 不同,AgentHijack-Agent 显式分离了接地增强与环境感知,通过旁观者模块主动应对动态干扰,从而大幅降低在 AgentHijack 基准上的性能衰减。
实验
实验设计
基于 OSWorld 环境构建 AgentHijack 基准,引入 9 种常见的、非对抗性环境干扰,包括弹窗、分辨率变化、遮挡、竞争应用等,覆盖影响代理感知与控制的主要因素。评估对象涵盖多种基于 MLLM 的电脑使用代理(开源与闭源模型),任务为一系列典型桌面操作工作流,以任务成功率作为核心指标,分别在无干扰和不同程度干扰条件下测量。
关键发现
- 所有代理在纯净环境下表现尚可,但引入干扰后成功率急剧下降,即使最轻微的干扰也造成显著退化,表明当前代理对动态环境极其脆弱。
- 干扰的影响程度与干扰类型及代理具体架构相关,但总体趋势一致:环境不确定性严重破坏代理的视觉理解和动作执行能力。
- AgentHijack-Agent 框架通过 动作生成器 增强对屏幕元素的定位(grounding),并通过 观察者 实时总结历史行为并检查环境变化,动态调整执行策略,有效缓解了上述问题。
与基线对比解读
与未做鲁棒性增强的通用代理相比,AgentHijack-Agent 并非简单增加重试或异常处理,而是通过结构化的“感知-总结-调整”机制主动规避干扰,更贴近人类处理意外弹窗或界面变化的方式。这一设计为未来代理鲁棒性研究提供了新的参考范式。但实验也显示,部分极端干扰仍难以完全克服,说明该方向需要持续深入探索。
行业影响
落地场景
AgentHijack 直接服务于所有依赖 MLLM-based 的计算机使用代理 (computer-use agents) 的产品。典型场景包括:
- 智能 RPA (Robotic Process Automation):代理在用户桌面执行跨应用操作(如数据录入、文件处理),真实环境中弹窗、分辨率缩放、竞争窗口会频繁中断流程。
- 自动化测试:基于视觉的 GUI 代理对移动或桌面应用进行回归测试,需要处理系统通知或动态布局变化。
- 虚拟办公助手:理解用户指令并操作 Office 套件、浏览器等,面对软件更新提示或临时遮挡时必须保持任务连续性。
商业价值
主要影响 降本 与 体验提升 两条线:
- 降低维护与监督成本:鲁棒性不足导致代理频繁失败,需人工介入核查与恢复。AgentHijack 提供的 corruption 评估及加固方案可显著减少故障率,允许更低的“人机协作”人力投入。
- 提高自动化覆盖率:过去因环境不确定性而放弃的自动化长尾任务(如需要绕过非预期弹窗的操作)现在可被可靠处理,直接提升流程自动化率。
- 产品可信度:更稳定的代理行为带来更好的用户口碑,有助于 ToB 产品在竞标中展示更高的任务成功率 (Success Rate)。
与现有产品 / 工作流的接口
AgentHijack 既可以作为 测试套件 集成,也能以 加固框架 形式部署:
- 作为测试基准:在 CI/CD 管线中加入 AgentHijack benchmark,对每一次模型或策略更新自动评估 corruption 鲁棒性,生成类似
Mean Success Rate under Corruption的指标。 - 组件化增强:AgentHijack-Agent 的 Action Generator(增强接地) 和 Onlooker(行为总结与环境检查) 两个模块可以微服务化,接入现有代理的推理回路。例如,在代理执行每一步前由 Onlooker 检查当前屏幕是否有异常(弹窗、分辨率偏移),触发重新规划或修正动作。
具体落地用例
电商后台自动化
代理负责在商品管理系统中批量上传商品详情、调整库存。实际运行时,浏览器可能弹出“系统维护提醒”或“权限过期”对话框,导致代理误点击或卡死。通过 AgentHijack 评估,可预先识别代理对弹窗处理的脆弱点,并用 AgentHijack-Agent 的 Onlooker 检测此类异常并触发关闭弹窗、重试等恢复动作,使端到端自动化成功率从 ~60% 提升至 85% 以上。金融报表自动生成
代理从多个内部 Web 系统抓取数据并填入 Excel 模板。过程中常遭遇屏幕分辨率变化(如远程桌面缩放)或其它应用窗口弹出遮挡关键区域。基于 AgentHijack 的 corruption 模拟,可训练代理在分辨率变化时重新搜索目标 UI 元素,或通过 Onlooker 感知遮挡并移动窗口,从而保证报表生成的完整性,减少财务人员的二次核查工作量。
局限
- **腐败类型覆盖度有限**:AgentHijack 虽定义了 9 种常见环境腐败(如弹窗、分辨率变化、竞争应用干扰),但仅覆盖了现实世界中的一部分干扰模式。例如,网络延迟、磁盘 I/O 瓶颈、驱动异常等系统级扰动未被纳入。此外,所有腐败均为预定义、可配置的合成干扰,与真实环境中动态涌现的复杂交互(如多个应用协同干扰、用户输入与代理控制的竞态)存在差距,可能高估了基准的可迁移性。
- **场景局限于桌面任务,通用性有待验证**:评估完全基于 OSWorld 等桌面环境,任务集中在文件管理、办公软件操作等固定工作流。对于日益重要的移动端 GUI 代理、跨设备工作流或浏览器自动化场景,未提供相应的腐败设计和基准变体。由于移动和 Web 环境的交互模式、视觉布局与桌面差异显著,当前基准难以直接迁移,限制了其对全栈计算机使用代理鲁棒性的评估能力。
- **AgentHijack-Agent 框架的观察者模块引入额外资源开销**:所提框架依赖独立的“观察者”进行行为总结与环境检查,该模块本质上是额外调用的 MLLM 推理流程,增加了延迟和计算成本。论文未详细分析该开销在实时交互场景下的影响,也未与轻量级异常检测方法(如视觉信号变化率、GUI 树比对)进行成本-收益对比,其工程实用性在延迟敏感型应用中存疑。