SeerGuard: 基于世界模型预测的移动GUI智能体安全框架
移动图形用户界面(GUI)智能体在自动化复杂任务中表现出色,但引入了关键的安全风险——单个错误动作可能导致不可逆后果。现有安全机制主要为响应式,缺乏执行前的风险评估能力。本文提出 SeerGuard,一个后果感知的安全框架,通过执行前指令级筛选与动作级风险评估来缓解这些风险。动作级评估分析当前GUI状态下智能体提议的动作,预测可能的结果以在动作执行前识别风险。为实现这些能力,我们通过多任务学习构建了统一的安全增强世界模型(SAWM),将语义下一状态预测与安全风险评估相结合。 大量实验表明,SeerGuard 能够有效泛化到多种移动GUI智能体。在 Qwen3-VL-8B-Instruct 上,它在 ω=0.8 时将安全效用分数从 0.191 提升至 0.596,在 α=0.8 时将风险成本分数从 0.347 降至 0.130。对 SAWM 的进一步分析验证了指令级筛选的有效性,以及动作风险评估和下一状态预测的能力。
论文精读
TL;DR SeerGuard 是一种移动 GUI 智能体安全框架,通过世界模型在执行前预测动作后果、筛选危险指令并评估风险,将 Qwen3-VL-8B 的安全-效用分从 0.191 提升至 0.596,风险成本分从 0.347 降至 0.130。
问题
问题背景
移动 GUI Agent 借助多模态大模型能够自主完成复杂任务,但直接操作真实界面意味着单步错误即可能造成不可逆后果(如误支付、隐私泄露),因此 预执行安全评估 成为该领域当前的核心关注点。
现有方法的局限性
当前安全机制多为反应式(reactive),常见手段包括执行后日志审计、关键词黑名单过滤或规则拦截。它们存在以下关键技术局限:
- 缺乏前摄预测能力:无法在动作执行前推测界面状态变化与潜在危害,只能事后止损。
- 规则粒度粗糙:基于关键词或固定模式的检查难以理解复杂交互语义,在高危操作(如转账确认、删除账号)中漏报率高,且对多步累积风险基本无效。
- 评估层次单一:没有区分指令级(任务意图安全性)和动作级(单步操作风险),导致整个任务链条的安全保障存在盲区。 这些缺陷使现有方法难以满足真实部署场景对安全与效用平衡的需求。
为什么这个问题难且重要
核心挑战在于构建一个能理解 GUI 动态的“世界模型”:
- 世界模型训练数据难获取:需要覆盖足够多样的状态-动作-后果三元组,尤其要高覆盖地包含风险边缘案例。
- 实时性与准确性平衡:移动端推理对低延迟要求严苛,安全评估不能显著拖慢 Agent 响应,同时还需结合
ω等参数来调节安全-效用权衡,防止过度保守让 Agent 失去实用性。 - 风险量化的模糊性:不同于分类任务的确定性指标,动作安全性的评判常带有语义模糊性,需要统一的评估框架(如风险-代价评分)来横向对比不同防护策略。
随着 GUI Agent 从研究走向个人助理、金融操作等场景,一次安全事故就足以摧毁用户信任,阻碍商业化落地。因此,预执行安全已成为移动 Agent 规模化部署的必经关卡。
行业类比
类似自动驾驶中的预测性安全模块(Predictive Safety)在路径规划阶段即评估碰撞风险,移动 GUI Agent 同样需要“视觉-动作-后果”的预判能力,将安全从事后审计前置为主动防御。
核心洞察
- SeerGuard 通过 **世界模型** 预测执行前后果,将安全从事后补救转为事前主动风控。现有移动 GUI agent 安全机制多为反应式(例如事后的状态恢复或行为拦截),而 SeerGuard 利用训练好的 **安全增强世界模型 (SAWM)** 在动作执行前预测下一状态并评估风险,从根本上防止不可逆操作发生。这种预判式防御思路与基于规则或事后审计的方法形成本质差异,为高风险自主交互提供更可靠的安全基础。
- SeerGuard 在单一模型中融合了 **语义下一状态预测** 与 **安全风险评估** 两种任务,通过多任务学习共享 GUI 动态表征,既提升模型对界面状态变化的理解,又注入安全先验。相比独立训练的安全分类器或仅依赖 task-specific 风险模型,SAWM 的联合训练使得风险评估更贴合真实的交互后果,且无需为每个 agent 单独定制安全模块,展示了更强的跨 agent 泛化能力和部署灵活性。
方法
整体流程:指令 → 筛选 → 动作风险评估
输入:用户自然语言指令、当前 GUI 状态(截图 + 视图树)以及 GUI agent 提出的候选动作(如点击、滑动、输入)。
指令级筛选(Instruction-level Screening)
基于语义分析判断指令本身是否属于高风险意图(如转账、删除数据、授权敏感权限)。若被划分为危险指令,系统直接阻拦并请求用户二次确认;否则进入下一步。动作级风险评估(Action-level Risk Assessment)
将当前 GUI 状态与待执行动作送入统一的安全增强世界模型 SAWM。SAWM 同时完成两项任务:- 语义下一状态预测:预测执行该动作后界面的语义表示,为潜在后果提供上下文依据。
- 安全风险评分:输出该动作引发不良后果的概率或风险等级,综合考量界面变化带来的隐忧。
输出:风险分数若超过设定阈值,则拒绝动作并引导 agent 调整;否则允许执行。同时,预测的下一状态语义表示可供后续任务规划复用。
SAWM 模型架构与多任务训练
SAWM 基于视觉-语言编码器,将 GUI 界面和动作映射到统一嵌入空间,共享编码参数,上方分设两个任务头:
- 下一状态预测头:通过对比学习,使预测的语义表示逼近真实下一状态的嵌入,损失函数鼓励正样本靠近、负样本远离。
- 风险评估头:使用交叉熵或均方误差,监督信号来自人工标注的安全数据集,标签覆盖安全/风险动作及其严重程度。
训练数据通过自动脚本与人工复核构造,覆盖邮件、支付、系统设置等多类移动应用场景,确保世界模型能够感知不同领域的风险模式。
与同类方法的核心差异
SeerGuard 是预执行、后果感知的安全框架,将世界模型预测与安全评估紧密结合,能够预先推演动作带来的界面变化并量化风险,而非传统方法中的事后规则匹配或黑名单拦截。
实验
实验设计
SeerGuard 在移动 GUI 代理上验证,框架包含两级防护:指令级筛选 (instruction-level screening) 阻止高风险任务,动作级风险评估 (action-level risk assessment) 在每步执行前预测后果。核心是安全增强世界模型 (SAWM),通过多任务学习同时预测语义下一状态和安全风险。
评估在 Qwen3-VL-8B-Instruct 基准代理上进行,测试安全性-效用平衡及风险代价,并分析 SAWM 各部分的有效性。
关键发现
- 安全性-效用分数大幅提升:ω=0.8 时从 0.191 提至 0.596,说明在维持任务效用的同时大幅增强安全性。
- 风险代价显著降低:α=0.8 时从 0.347 降至 0.130,即代理执行危险动作的代价大幅减少。
- SAWM 的指令筛选和动作风险评估均有效,世界模型的下个状态预测能力有助于风险识别。
与基线对比的深度解读
基线为未添加 SeerGuard 的 Qwen3-VL-8B-Instruct 代理,其原始安全分数极低 (0.191),反映出多数 GUI 代理在缺乏预执行防护时极易因单步错误造成不可逆后果。SeerGuard 通过预执行的两层感知,将安全性-效用分数提升近 3 倍,表明其能在实际应用中有效拦截危险操作;风险代价下降超一半,证实模型预测的后果与真实风险高度一致。该提升不依赖特定代理架构,具备良好的通用性,为移动 GUI 自动化部署提供了轻量化、可复用的安全底座。
行业影响
落地场景
SeerGuard 可直接嵌入移动 GUI 自动化产品,覆盖需要高可靠性的交互场景:
- 金融类 App 的自动化操作(如转账、支付确认前的风险拦截)
- 电商智能下单代理(避免误触促销按钮导致错误购买)
- 企业 RPA 移动端扩展(处理报销审批、合同签署等敏感流程)
- 无障碍辅助工具(为视障用户读屏操作提供安全护栏)
商业价值
核心在于将移动 Agent 从“功能可用”推向“安全可靠”,直接降低因错误操作引发的资金损失、隐私泄露和品牌风险。
- 降本:减少人工审核与回滚成本,尤其在高频自动化任务中效果显著
- 增收:安全边界拓宽后,Agent 可承担更高价值的任务(如金融交易、医疗预约),扩大可自动化业务范围
- 体验提升:用户信任度增加,推动产品采纳率
与现有产品/工作流的接口
SeerGuard 作为独立安全模块,提供标准 API 供现有 Agent 框架调用:
- 输入:当前 GUI 状态(截图 + UI 树)、任务指令、候选动作
- 输出:指令级筛选结果 + 动作级风险评分
- 可集成到 AutoGLM / OS-Copilot / AppAgent 等主流框架的决策循环中,在动作执行前插入一次安全检查
- 论文公开代码与模型权重,支持私有化部署或云端调用
具体落地 Use Case
- 金融交易自动化:某银行 App 的智能助理在执行“向联系人转账 500 元”时,SeerGuard 通过下一状态预测发现可能进入免密支付页面,提前拦截并提示用户二次确认,避免因 UI 误识别导致的资金损失。
- 电商售后自动化:电商平台的退换货 Agent 在点击“仅退款”前,SeerGuard 评估该操作会导致订单状态不可逆变更,结合用户原始意图(如“换货”)进行风险告警,防止商家资损。
局限
- SeerGuard 的安全评估严重依赖 **安全增强世界模型 (SAWM)** 的预测准确性,SAWM 的下一状态生成与风险分类若存在偏差,会直接导致误判。论文未评估 SAWM 在面对与训练分布差异较大的未知 GUI 操作或对抗性输入时的幻觉率,也未讨论校准方法,这在实际动态环境中可能导致假阴性(危险操作漏报)或假阳性(过度拦截),大幅降低代理实用性与用户信任。
- 实验仅基于 **Qwen3-VL-8B-Instruct** 一种代理模型,缺乏对 **GPT-4V、Claude、Gemini** 等不同架构 VLMs 的跨模型泛化验证。此外,评测仅限移动端场景,未涉及桌面或 Web 界面,而各平台的操作空间与风险模式差异显著,SeerGuard 的模块化适配难度和可迁移性尚不明确,作为通用安全层的工程落地存在风险。
- SeerGuard 仅提供执行前的指令级与动作级筛选,未设计运行时实时监控或执行后的回滚恢复机制。移动交互中的弹窗、网络抖动等动态事件可能使预计算的静态风险失效,而纯学习式的世界模型缺乏形式化安全保证,在金融交易等高风险场景下难以提供可审计的安全边界,与基于策略或约束的安全框架相比鲁棒性不足。