论文

HazardAuditor:从可执行威胁到更安全的 Computer-Use Agents

HazardAuditor:从可执行威胁到更安全的 Computer-Use Agents

Computer-use agents 正越来越多地与浏览器、终端、文件系统和外部服务交互,其安全风险源于运行期行为,而不只是生成内容。现有 guard models 面向静态 prompt 与 response,难以适配 agent 执行;已有的可执行安全平台只输出评估判定,而非 guard model 跨异构 agent 框架学习所需的规范化监督信号。 HazardAuditor 是一个执行接地的框架,同时填补这两处空白。其基础设施在受控环境中运行异构 agent(Claude Code、Codex、Hermes 与 OpenClaw),并把它们的交互规范化成统一的 canonical event 表示,以支持跨框架监督。 作者进一步指出,token 级后训练目标与生成式 guard 存在结构性错配,使更长的 rationale 主导梯度更新。Guard Policy Optimization(GuardPO) 通过将确定性的安全结果转化为序列级优势,并对 rationale 与 verdict 区域做归一化,令安全决策成为优化的有效单元。 在多个 benchmark 与异构 computer-use 系统上,HazardAuditor 相比最强的既有 guard 最高提升 16.5 个百分点 的准确率。代码、模型与评测产物将发布于 https://yunhao-feng.github.io/HazardAuditor/ 。

论文精读

TL;DR HazardAuditor 以执行级监督统一异构 agent 运行时事件,并通过 GuardPO 将安全决策转化为序列级优化单元,使生成式安全守卫准确率最高提升 16.5 个百分点。

问题

问题背景

计算机使用代理 (computer-use agents) 在浏览器、终端、文件系统等执行环境中的安全风险日益受到关注,安全评估的焦点从静态生成内容转向运行时行为。

现有方法局限

当前的 guard models 主要针对静态 prompt 和 response 进行训练,无法捕捉代理执行轨迹中的危险动作(如修改系统文件、执行 shell 命令)。已有的 executable safety platforms 虽然能在沙箱中运行代理并产生评估 verdict,但输出的是非规范化的评估结论,缺少跨异构框架(如 Claude Code、Codex)统一监督信号,难以直接用于训练 guard model。此外,生成式 guard 的 token-level post-training 存在结构性偏差:长 rationale 占据梯度更新的主导,安全判定本身被稀释,导致模型在关键决策上优化不足。

为什么难 / 重要

异构代理框架的交互格式差异大,需要将不同事件流归一化为 canonical representation 才能进行跨框架监督;危险行为常常嵌入冗长的执行轨迹中,要求 guard model 具备细粒度行为理解而非浅层文本匹配。业界对代理安全的诉求显著上升,但缺乏可扩展、执行级的安全训练基础设施。

行业类比

类似于自动驾驶从感知静态交通标志转向实时监控车辆操控行为,计算机使用代理的安全防护也需要从输出审查转向执行过程的规范化监督。

核心洞察

  • 执行轨迹规范化为跨框架安全监督提供了统一界面。现有 guard model 仅针对静态 prompt-response 判断,而 executable safety platforms 只输出评估结论,无法为生成式守卫模型提供可学习的监督信号。HazardAuditor 在受控环境中运行 Claude Code、Codex 等异构 agent,并将交互规范化为 canonical event representation,从而让安全策略脱离具体 agent 框架差异,使 guard model 真正学习到行为层面的危险模式。
  • Guard Policy Optimization 将安全决策从 token 级优化中解耦,使判决 token 成为唯一有效优化单元。传统生成式 guard 采用 token-level post-training(如 SFT/DPO),导致较长的 rationale 占据梯度主导,而安全判定 token 的损失被稀释。GuardPO 把确定性安全结果转换为 sequence-level advantage,并对 rationale 与 verdict 区域分别归一化,迫使模型在决策点而非论证长度上提升判别能力,这是对现有 RLHF/DPO 在安全守卫领域的目标修正。

方法

输入与执行基础监督

HazardAuditor 的输入是异构计算机使用 agent(如 Claude Code / Codex / Hermes / OpenClaw)在受控环境中产生的原始执行轨迹。框架先通过执行基础设施捕获这些 agent 的浏览器、终端、文件系统与服务交互事件,并将它们归一化为 canonical event representation,实现跨框架的统一监督。这一步区分了行为风险 与内容风险,使后续守卫模型能够聚焦于运行时行为而非静态文本。

生成式守卫与 GuardPO

归一化事件流输入到生成式守卫模型,模型同时输出 rationale 和 safety verdict。针对传统 token 级后训练目标中长 rationale 主导梯度更新的结构性问题,GuardPO 引入两个关键设计:

  • 序列级优势:将确定性的安全结果转换为 sequence-level advantage,使安全决策成为有效优化单元。
  • 决策归一化目标:对 rationale 区域和 verdict 区域分别归一化,并采用 clipped token update,防止过长推理链稀释决策信号。

输出与差异点

最终输出为对执行轨迹的二元或分级安全判断,可直接用于运行时拦截或事后审计。与现有内容守卫模型仅看 prompt/response、执行安全平台仅产出评估结论不同,HazardAuditor 首次将执行基础监督与生成守卫的训练目标对齐,弥补了异构 agent 安全监督的空白。

实验

实验设计

HazardAuditor 搭建了执行环境,运行 Claude Code、Codex、Hermes、OpenClaw 四种异构 agent,将其交互归一化为 canonical event representation,形成跨框架监督数据。训练生成式 guard 模型时,采用 GuardPO 将安全结果转化为序列级优势,归一化 rationale 与 verdict 区域,使安全决策成为优化单元。评估覆盖多个 benchmark(含 NSFA、跨框架固定测试集)。

关键发现

  • HazardAuditor 在准确率上相比最强先验 guard 提升最高 16.5 个百分点。
  • 执行环境训练的 guard 能更好捕捉运行时行为风险,而非仅依赖静态内容。
  • 跨框架迁移表现良好,证明归一化事件表示有效。

与基线对比解读

现有 guard 模型针对静态 prompt/response,不适合 agent 执行;可执行安全平台输出评判但缺乏规范化监督。HazardAuditor 通过执行基础监督与 GuardPO 填补两项空白。对工程实践的启示:需构建统一的轨迹中间层以支持异构 agent 的安全监控;训练生成式 guard 时,应使用序列级目标而非 token 级目标,避免长 rationale 主导梯度。

行业影响

落地场景

HazardAuditor 可嵌入企业级计算机使用智能体的安全监控层,适用于 浏览器自动化 、终端命令执行 、文件系统操作 等场景。典型用例:电商平台 的订单处理 agent 在操作后台时可能触发越权或数据泄露;金融机构 的报表生成 agent 调用内部 API 时需要实时判定高风险行为;企业服务 中的编码 agent(如 Claude Code / Codex)需要防止危险命令注入。传统内容安全模型无法覆盖运行时行为,而 HazardAuditor 的规范化事件表示可跨框架统一审计。

商业价值

主要收益在 风险控制与合规降本 。通过减少恶意或误操作导致的数据泄露、服务中断,可显著降低安全事件响应成本(人工审计、赔偿、监管处罚)。同时,执行接地训练使守卫模型精度提升(相较最强先验最多提升 16.5 个百分点),减少误报对业务中断的影响,提升用户体验。对提供 agent 平台的云厂商或安全厂商,可作为增值安全服务销售。

与现有工作流集成

可作为 独立守卫服务 部署在 agent 执行链路上,接收规范化事件流并返回实时安全判定。集成方式与现有 guardrails 类似:通过 SDK 或网关拦截 agent 的每一步动作,将轨迹转换为 HazardAuditor 的 canonical event representation ,再调用守卫模型(生成式推理或快速分类头,见论文 G 节效率对比)。对于已有安全运营中心(SOC),可将判定结果接入 SIEM 或告警系统,实现统一审计。开源代码与模型权重(GitHub)降低了集成门槛。

局限

  • - **框架依赖与泛化受限**:HazardAuditor 的 infrastructure 目前仅集成 Claude Code、Codex、Hermes、OpenClaw 四种 agent,归一化事件表示对新框架需要额外适配;实验均在 controlled environments 中进行,真实生产环境的动态性、恶意对抗和长期运行风险尚未覆盖,跨环境迁移证据有限。
  • - **GuardPO 假设确定性安全标签**:该方法将安全结果转化为序列级 advantage 并归一化 rationale/verdict 区域,适用于明确的 binary safety 判定;但在模糊边界、噪声标签或需要不确定性估计的场景,优势信号可能失真。同时生成式 guard 推理成本高,论文也指出 fast classification heads 存在 probability quality 与延迟的 trade-off。
  • - **评估维度与对比有限**:实验主要基于现有 benchmark 和固定测试集,缺少真实 agent 长期交互中的自适应攻击评估;虽然报告最高 16.5 pp 提升,但未明确该增益来自哪个具体设置,且与 rule-based 执行监控、非生成式分类器的全面对比不足,难以分离数据规模、基础设施与 GuardPO 本身的贡献。
论文Yunhao Feng2026-09-14原文

相关内容