论文

BraveGuard: 从开放世界威胁到更安全的计算机使用代理

BraveGuard: 从开放世界威胁到更安全的计算机使用代理

计算机使用代理将语言模型从文本生成扩展到与文件、终端、浏览器和外部工具的持续交互。这种转变带来了安全风险,但难以从孤立的提示或最终响应中检测,因为危害往往通过多步执行轨迹出现,而单个动作看似良性。 我们提出 BraveGuard,一个自我进化的防御框架,从 开放世界威胁信号 和 真实代理轨迹 中训练守卫模型。BraveGuard 挖掘近期研究资源以识别新兴风险和攻击模式,将其实例化为可执行的计算机使用任务,收集代理展开轨迹,并推导出轨迹级监督信号用于守卫模型训练。随着新威胁和验证失败出现,该流水线可重复运行,形成自适应防御循环而非静态基准驱动过程。 我们实例化了 BraveGuard,训练了多个守卫骨干模型(包括 Qwen3-Guard 和 Llama-Guard 变体),并在轨迹级代理安全基准 AgentHazard 上评估。BraveGuard 持续提升了计算机使用轨迹的安全检测能力:在平均守卫模型设置下,检测准确率从 38.79% 提升至 82.38%。结果表明,基于开放世界威胁发现和真实代理执行的守卫监督可以超越固定分类法和合成提示级数据,提升安全监控。BraveGuard 为应对不断变化的现实世界风险的计算机使用代理提供了一条可扩展的自适应防御路径。

论文精读

TL;DR BraveGuard 通过从开放世界挖掘威胁、合成攻击任务并采集 agent 轨迹,训练自适应 guard 模型,将计算机使用 agent 的安全检测准确率从 38.79% 提升至 82.38%。

问题

问题背景

计算机使用代理(Computer-use agents)将大语言模型从文本生成扩展到与文件系统、终端、浏览器等持续交互,这种能力在提升自动化水平的同时,也带来了新的安全风险。

现有方法局限

当前的主流安全防护模型(guard models)如 Llama GuardQwen Guard 等,存在三个明显弱点:

  • 单点判定:仅针对单轮对话或最终响应进行安全评估,忽略代理在多步执行过程中逐步累积的轨迹上下文;
  • 分类闭集:依赖预定义的危害分类法(taxonomies),无法应对开放世界中动态演变的攻击模式,特别是由多个看似良性的中间步骤构成的组合式恶意行为;
  • 数据脱节:训练数据多为合成提示样本,缺少真实代理与操作系统交互的执行级轨迹,导致模型对序列行为(如连续的文件读写、网络请求)中的隐蔽危险不敏感。

技术挑战与重要性

代理安全检测面临两个核心难题:

  1. 局部良性、全局有害:单个操作(如 cat 一个文件或发起一次 curl 请求)可能完全正常,但完整的执行轨迹可能构成数据窃取或系统破坏,需要模型具备轨迹级推理能力,理解操作间的因果与意图。
  2. 威胁快速演变:攻击技术不断从研究社区和漏洞披露中涌现,静态的离线训练无法及时覆盖新风险,防御系统必须拥有自进化能力。

随着 Anthropic Computer UseOpenAI Codex CLI 等代理接口的开放,这类系统若被滥用可能直接导致企业数据泄露或基础设施损坏,业界迫切需要主动、自适应的代理安全监控方案。

行业类比

类似于网络安全中的基于系统调用序列的入侵检测(而非单事件日志分析),BraveGuard 从代理执行轨迹中学习危害模式,为代理行为提供序列级安全审查,正如安全系统通过进程行为序列识别高级恶意软件,而非仅匹配单个API调用签名。

核心洞察

  • - **开放世界威胁发现与自我进化循环**:BraveGuard 并非依赖静态威胁分类或合成提示数据,而是持续从最新研究资源中挖掘新兴攻击模式,实例化为可执行计算任务,收集真实 Agent 轨迹,据此迭代训练 Guard 模型。这种“发现-合成-训练-评估”闭环使防御能够自适应地应对不断演变的现实威胁,突破了现有 Guard 模型仅基于固定基准或一次性训练集的被动范式。
  • - **轨迹级安全监督**:传统 Guard 方法多聚焦于隔离的提示或最终响应,难以捕获多步交互中局部良性但整体有害的执行痕迹。BraveGuard 直接从完整 Agent rollout 中导出轨迹级标签,训出的 Guard 能有效感知分布式危害,在 AgentHazard 上将平均准确率从 38.79% 提升至 82.38%,证明了面向计算机使用 Agent 的时空联合安全监测显著优于单点检测。

方法

方法核心:自进化防御流水线

BraveGuard 构建了一条从威胁发现到守卫模型训练的自进化流水线,关键输入为开放世界的最新安全威胁信号(如论文、漏洞报告),输出是一个能够检测智能体多步轨迹安全性的守卫模型。

1. 开放世界威胁发现
模块自动挖掘近期的学术论文、安全公告与攻击分析,识别新兴风险模式(如数据窃取、权限提升、隐蔽指令注入)。这些威胁被抽象成结构化的威胁描述,不再依赖固定的分类体系。

2. 攻击合成与智能体轨迹收集
基于威胁描述,系统生成可执行的计算机使用任务(例如,诱导智能体执行恶意代码或泄露敏感文件)。这些任务通过 OpenClaw 环境分发给目标计算机使用智能体执行,完整记录每一步操作(终端命令、文件读写、浏览器交互)。由此获得大量真实的多步执行轨迹,其中单步行为往往看似无害,但累积造成危害。

3. 轨迹级监督与守卫训练
为每条轨迹自动标注安全或危险标签,形成轨迹级监督信号(而非孤立的提示或最终回复)。随后,使用这些数据微调现有的守卫模型骨干(如 Qwen3-GuardLlama-Guard 变体)。训练时,模型学习从完整交互历史的上下文里检测隐蔽恶意,而不再局限于单条消息的静态分析。

4. 评估与闭环进化
在验证集上评估守卫模型,将失败案例和新发现的威胁重新注入威胁发现阶段,触发下一轮数据生成与训练。这种 自适应防御循环 使守卫模型能持续适应新出现的安全风险,无需等待滞后的人工标注或基准更新。

与同类方法的差异点:现有方案多基于预定义安全分类与合成提示数据,不能覆盖多步交互中的涌现危害;BraveGuard 则通过真实威胁挖掘与智能体实际轨迹构建训练管道,实现了从静态防御到自进化的关键转变。

实验

实验设计

BraveGuard 构建自演化防御循环:开放世界威胁发现 从近期论文中识别攻击模式,将其合成为可执行任务,利用 OpenClaw 收集代理轨迹,并以此训练轨迹级守卫模型(骨干包括 Qwen3-Guard、Llama-Guard 等)。评估在 AgentHazardR-JudgeASSE-Safety 三个轨迹安全基准上进行,主指标为分类准确率,并辅以消融研究。

关键发现

  • AgentHazard 上,BraveGuard 将平均准确率从基线的 38.79% 提升至 82.38%+43.59%)。
  • 消融实验显示:移除轨迹级监督或威胁合成环节均导致显著性能下降,证明真实代理轨迹和新兴威胁知识对守卫训练至关重要。

与基线对比

现成守卫模型(如 Qwen3-Guard、Llama-Guard)依赖固定风险分类和提示级数据,难以捕捉计算机使用代理在多步交互中累积的隐蔽危害。BraveGuard 通过 轨迹级监督 暴露“局部无害、整体有害”的攻击链,使守卫能够感知操作上下文。其自演化机制可持续注入新威胁信号,避免静态基准的过时问题。在数据外泄等复杂攻击场景中,BraveGuard 显著优于传统守卫,展示了面向真实世界演化风险的实用防御能力。

行业影响

落地场景

BraveGuard 适用于任何部署了 computer-use agent 的产品线,例如电商客服自动化、金融交易助手、DevOps 助理、内容合规审核、医疗数据管理、自动驾驶云端运维等。这些 agent 在与文件系统、终端、浏览器持续交互时,单步操作看似无害,但多步轨迹可能演化为高风险行为(如数据窃取、权限滥用)。BraveGuard 作为自适应安全护栏,可实时检测此类潜伏威胁,填补传统 prompt-level 防护的空白。

商业价值

  • 降本:自动识别新威胁,减少人工审核与安全事件响应开销;防止 agent 违规操作导致的业务损失与合规罚款。
  • 增收:提升 agent 产品的安全信誉,加速金融、医疗等合规敏感领域的采用,扩大市场规模。
  • 体验提升:在不过度阻断正常任务的前提下,精准拦截危险行为,维持 agent 流畅度,增强用户信任。

与现有产品 / 工作流的接口

BraveGuard 以轻量级 guard 模型形态集成,可直接嵌入 Agent 框架(如 LangChain、AutoGPT、CrewAI)的决策循环。在 agent 每一步执行后或整个轨迹完成后,调用 guard 模型输出安全评分。根据阈值触发拦截、回滚或人工审核。自进化管道可对接已有的安全分类器 API 或日志系统,定期从实时威胁情报源(如 CVE 公告、攻击研究报告)挖掘新风险、合成新训练样本,微调 guard 模型,形成持续防御闭环。

具体落地用例

  1. 金融交易 agent:agent 处理投资组合调整与转账。BraveGuard 监控其工具调用序列,检测如“先查询敏感客户数据,后发起外部转账”的多步组合攻击,即便单步动作符合权限规则,也能识别上下文敏感的数据渗出模式
  2. DevOps 自动化:agent 管理云资源,可执行 Shell 命令。BraveGuard 分析命令历史与系统状态变化,判断删除生产数据库是否是恶意意图(如内部攻击模拟),通过轨迹级别的异常检测防止灾难性操作,同时允许合法的维护任务。

局限

  • **开放世界威胁发现**完全依赖于研究论文中的公开威胁信号,难以覆盖未公开的零日攻击或企业定制的隐蔽攻击模式。当攻击手法未在学术文献中出现时,BraveGuard 的威胁池可能出现盲区,导致 guard 模型对突变风险泛化不足。这在实际高危生产环境中尤为关键,因为攻击者往往利用未披露的漏洞。
  • 实验仅在 **AgentHazard** 单一基准上验证,虽然提升显著,但该基准任务分布与真实计算机使用 agent 的多样性(如不同操作系统、不同工具集、多模态交互)可能不同。在其他环境下的安全性检测能力未经测试,限制了结论的普适性。此外,guard 模型自身对对抗性轨迹(如故意误导的良性动作序列)的鲁棒性未作分析。
  • 自进化循环虽然理论上可持续更新,但实际流程中仍需人工审核威胁信号与轨迹标注,自动化程度有限。随着威胁池扩大,人工成本线性增长,且难以保证标注一致性。同时,论文未讨论频繁重训带来的计算开销与潜在灾难性遗忘,部署维护的工程复杂度较高。
论文Yunhao Feng2026-06-02原文

相关内容