SkillHarness:为计算机使用代理驾驭安全技能
问题:计算机使用代理(Computer-Use Agents, CUAs)在动态交互环境中部署时,需要持续学习技能。现有方法假设环境静态安全,忽略了对抗交互(如提示注入)和环境变化(如弹窗)的风险,导致技能学习不安全、执行不稳定。 方法:本文提出 SkillHarness 框架,将技能学习与使用建模为安全约束的交互过程。具体包括:1)技能边界(Skill Boundary)利用多源监督信号从轨迹中识别安全技能;2)自我改进的安全约束(Self-Improving Safety Constraints)在技能生命周期中持续优化;3)选择性技能复用(Selective Skill Reuse)根据上下文分解任务并激活子技能集。 实验:在动态环境下的实验表明,SkillHarness 将技能不安全率降低 57.1%,并持续提升执行稳定性,优于现有基线。
论文精读
TL;DR SkillHarness 让计算机使用代理在动态环境中安全学习技能,通过技能边界和选择性复用降低 57.1% 的不安全技能率,提升执行稳定性。
问题
问题背景
Computer-Use Agents (CUAs) 正被部署到动态交互环境中,持续学习可复用的技能 (skills) 成为其应对新任务的关键。业界关注如何让代理在交互过程中自动积累经验,形成可迁移的操作模式。
现有方法局限
当前技能学习方法(如从成功轨迹中提取可复用片段)隐含静态与安全环境假设,忽略了真实部署中的两类风险:
- 对抗交互 (adversarial interactions):例如提示注入 (prompt injections),可能将恶意指令混入轨迹,诱导代理学习危险行为。
- 环境动态性 (environmental dynamics):如弹窗、界面变迁,导致固化技能在变化场景下执行失败或产生副作用。 这些方法缺少对技能安全性的显式建模,无法区分轨迹中的安全与风险模式,学到的技能容易包含不安全操作,且无法根据上下文动态调整,导致执行脆弱、可靠性下降。
技术挑战与重要性
该问题的核心难点在于安全约束与技能学习生命周期的融合:
- 技能从交互轨迹中无监督涌现,但轨迹混杂安全与风险信号,必须设计多源监督(如结果校验、策略合规)来界定技能边界 (skill boundary)。
- 动态环境中攻击与变化不可预测,安全约束需具备自我改进能力,随技能库演化持续更新。
- 执行时需选择性激活技能子集,根据当前上下文过滤不安全或不适用的技能,避免盲目复用。 随着 CUAs 在办公自动化、网页交互等场景的实用化,安全可靠地驾驭技能成为落地前提,学术界和工业界均高度关注这一基础设施层问题。
行业类比
该挑战类似于自动驾驶系统从海量驾驶数据中学习驾驶策略,但必须过滤危险驾驶片段,并根据路况动态选择安全子策略——任何未经验证的复用都可能引发事故。
核心洞察
- 将技能学习建模为安全约束的交互过程,而非静态抽象。现有方法假设环境安全,直接从成功轨迹提取技能,忽视了对抗注入和环境弹窗等动态风险,导致学习到不安全技能并产生脆弱执行。SkillHarness 提出技能边界,融合成功模式、经验教训和风险守卫等多源监督信号,构建自改进的安全约束,贯穿技能生命周期,从源头抑制风险,将安全从外部校验转变为技能的内在属性。
- 选择性技能重用:SkillHarness 不将技能视为固定程序,而是根据实时上下文动态分解任务并激活技能子集。传统方法机械执行整个技能,在动态环境中易因上下文突变而失败或触发危险行为。选择性重用使 Agent 能灵活组合安全子技能,避开风险部分,显著提升执行稳定性,在基准测试中不安全率降低 57.1%,且模型规模越大优势越明显,揭示了安全性与自适应性的强关联。
方法
输入与威胁建模
SkillHarness 以交互轨迹和任务上下文为输入,首先定义动态环境下的威胁模型,将对抗性交互(如 prompt injection)和环境扰动(如弹窗)纳入安全考量。轨迹被解析为结构化的技能表示,解耦为宏技能(粗粒度任务单元)和微技能(细粒度操作原语),两者构成可复用的技能字典。
技能学习:安全边界与自改进约束
从交互轨迹中,SkillHarness 通过技能提议模块生成候选技能,随后进入核心的技能边界机制。该边界利用多源监督信号(任务成功与否、安全策略合规性、环境反馈)将每个候选技能归类为三类模式:
- 成功模式 𝒫:安全且有效的执行路径;
- 经验教训 ℒ:失败或低效的 pattern,用于修正;
- 风险守卫 ℛ:识别出的不安全行为,触发约束生成。 这些模式共同驱动技能进化——在整个技能生命周期中,系统持续更新安全约束,形成自改进的安全边界。当环境变化或新的攻击出现时,边界动态收紧,从而过滤掉 57.1% 的不安全技能学得。
技能利用:选择性复用与上下文感知执行
在执行新任务时,SkillHarness 采用选择性技能重用策略。首先由技能检索模块根据当前上下文从技能库中召回相关技能子集,然后由规划器将任务按情境分解为子目标,并通过安全约束检查剔除不安全的技能组合。最后,执行器仅激活通过安全过滤的技能子集完成操作,避免全量技能激活带来的风险。整个过程类似“保险丝”机制,确保即使部分技能受污染,整体任务仍可稳定完成。
输出与差异点
框架输出一套经过安全验证的技能库和对应任务的执行计划。与现有方法(如从静态成功轨迹中无条件学习技能)相比,SkillHarness 首次将技能学习建模为安全约束交互过程,引入动态技能边界和选择性重用,而非假设环境无害。这使得 CUAs 在对抗和动态环境中能可靠地持续学习。
实验
实验设计
实验在四个动态交互基准上评估 SkillHarness:ST-WebAgentBench(网页智能体安全)、WASP(对抗性提示注入)、OS-Harm(操作系统危害)和 OpenApps(应用交互式任务)。
评估指标覆盖技能学习安全性与执行稳定性,包括 Success Rate (SR)、Attack Success Rate (ASR)、Completion under Policy (CUP)、Unsafe Skill Rate (USR) 和 Skill Completion Rate (SCR)。
对比基线为现有基于成功轨迹的技能学习方法。
关键发现
通过引入 skill boundary 和 self-improving safety constraints,SkillHarness 在学习阶段显著降低不安全技能的引入——USR 相对降低 57.1%,表明多数危险轨迹被有效过滤。
在技能利用阶段,selective skill reuse 依据上下文动态分解任务并仅激活安全技能子集,使得动态环境(如弹窗、注入攻击)下的 SR 和 CUP 保持稳定,而基线方法常因技能误用导致崩溃。
消融实验证实:移除安全约束后 USR 大幅回升,而舍去选择性重用则执行成功率明显波动。
与基线对比解读
基线方法在静态环境中表现尚可,但在动态交互中倾向于学习到含对抗提示或高危操作的技能,导致执行风险与不稳定性。SkillHarness 的核心差异在于:
- 将技能学习建模为 安全约束交互过程,而非简单的轨迹抽象;
- 多源监督信号(成功模式、教训、风险守卫)持续更新技能边界,随生命周期自我完善。
因此,SkillHarness 不仅在安全性上远超无约束方法,其选择性重用还将任务成功率与策略遵从性解耦,避免了“高成功率但低安全性”的陷阱。这一设计对实际部署中需要兼顾效率与安全的 Computer-Use Agents 具有重要工程参考价值。
行业影响
落地场景
SkillHarness 为需要长期自主运行的 计算机使用代理 (CUA) 提供了安全技能管理框架,直接适用于以下产品与业务:
- RPA/流程自动化: 浏览器自动化脚本、数据抓取爬虫,在页面结构变化或弹窗出现时保持鲁棒性。
- 智能助手/Agent: 如电商客服处理退款、订单查询时,需防御提示注入攻击或广告弹窗误导。
- 内容安全审核: 自动化内容审核系统在解析用户提交的文本/图片时,防止对抗性样本导致策略绕过。
- 金融交易自动化: 线上银行操作、自动投资流程需应对环境突变与恶意交互。
商业价值
- 降本: 通过
unsafe skill rate降低 57.1%,显著减少代理因不安全技能执行导致的故障排查与人工接管成本。 - 增收: 在客服、营销自动化等直接创收场景,提升代理在高频动态环境下的 执行稳定性 与任务成功率,直接拉动转化率。
- 体验提升: 用户无感知的持续可用性,避免因安全漏洞或环境干扰造成的服务中断,增强品牌信任。
与现有产品/工作流的接口
SkillHarness 可作为现有 LLM-based agent 框架(如 LangChain、AutoGPT)的 Skill 管理层插件 进行集成:
- 技能学习阶段: 在收集交互轨迹后,替换原有的无约束 skill 提取模块,通过
Skill Boundary过滤不安全经验。 - 任务执行阶段: 在调度器(Planner)与执行器(Executor)之间插入
Selective Skill Reuse模块,根据上下文动态选择安全技能子集。 - 监控与迭代: 利用
self-improving safety constraints定期更新安全策略,与现有 MLops 流程中的模型/策略版本管理衔接。
具体落地 Use Case
1. 电商智能退货代理
某跨境电商平台使用 CUA 自动处理退货请求,涉及与用户对话、调取订单 API 并生成退货标签。攻击者可能插入恶意提示,诱导代理退款到非法账户。引入 SkillHarness 后,代理从历史成功轨迹中提取技能时,自动标注出涉及敏感资金操作的 risk guard 约束,执行时仅在确认用户身份且无注入信号的分支中激活相关技能,避免资金损失。
2. 全球化内容审核系统
UGC 平台利用多模态 LLM 代理自动审核用户上传的图片与评论。对抗性图片可能包含隐藏文本,导致代理误判违规。SkillHarness 将每次审核决策建模为技能,通过 multi-source supervision 构建边界,防止代理学习到仅依赖表面特征的错误模式,并在内容环境变化(如新模因变异)时自适应调整安全约束,维持高准确率审核。
局限
- - 论文在“Discussion & Future Work”中承认**复杂技能抽象**与**harness 设计**仍存在挑战,表明当前基于宏/微技能的解耦表示和基于规则的选择策略在面对高度组合、长时跨任务时可能不够灵活,技能边界依赖于人工定义的多源监督信号质量,自动化程度有限。
- - 实验仅在有限类型的动态扰动(如 ST-WebAgentBench、WASP 等)上进行验证,未覆盖更广泛的对抗注入模式或动态环境突变,且**攻击成功率 (ASR)** 等指标可能因攻击者模型假设过强而无法完全反映真实风险,结果的泛化性需要更全面的鲁棒性测试。
- - 与纯粹基于轨迹的技能学习方法相比,SkillHarness 引入的持续**技能生命周期**约束和选择性激活机制会带来额外的计算与存储开销,尤其在探索阶段可能因过度保守的安全过滤丢弃有价值的经验,导致技能库积累效率低于无约束方法。