论文

AgentDoG 1.5: 一个轻量级且可扩展的AI Agent安全与安保对齐框架

AgentDoG 1.5: 一个轻量级且可扩展的AI Agent安全与安保对齐框架

现代开放世界 Agent(如 OpenClaw)展现出强大的跨环境执行能力,但也引入了广泛的新安全风险源。同时,前沿 AI 模型大幅降低了攻击门槛,使得当前 Agent 对齐框架无法满足实际部署需求。 为应对这些新兴威胁,我们提出一个轻量级且可扩展的 Agent 安全对齐框架。具体而言,我们更新了 Agent 安全分类法(safety taxonomy)以纳入来自 Codex 和 OpenClaw 执行场景的突发风险;进一步构建了分类法引导的数据引擎,结合影响函数净化(influence-function purification),仅用约 1k 样本训练出轻量级 AgentDoG 1.5 变体(参数规模 0.8B、2B、4B、8B),其性能可与 GPT-5.4 等领先闭源模型相媲美。 基于 AgentDoG 1.5,我们构建了高效的Agent 安全 SFT 和 RL 训练环境,将 Docker 级别环境的部署开销降低了两个数量级。最终,我们将 AgentDoG 1.5 部署为免训练的在线护栏,用于实时安全审核。广泛实验表明,AgentDoG 1.5 在多样复杂的交互式 Agent 场景中达到了 SOTA 性能。所有模型和数据集均已开源。

论文精读

TL;DR AgentDoG 1.5 仅用约 1k 样本便训练出 0.8B–8B 轻量安全对齐模型,在交互式 agent 场景中性能媲美闭源前沿模型,同时提供高效应训练环境和训练无关的在线安全护栏,全部模型与数据已开源。

问题

问题背景

随着AI智能体(如 OpenClaw)在开放环境中获得跨平台代码执行能力,它们在提升任务自主性的同时,也引入了从代码注入到环境操纵的全新安全风险源。前沿模型大幅拉低了攻击实施门槛,使得智能体安全对齐成为规模化部署前的核心瓶颈。

现有方法局限

当前智能体安全对齐存在三个技术短板:

  • 安全分类滞后:传统安全分类法多面向静态对话或固定环境,未覆盖 Codex、OpenClaw 等动态执行场景下特有的风险(如工具误用、多步因果故障),导致评估基准与实际威胁脱节。
  • 数据与训练低效:主流对齐依赖大规模人工标注或昂贵闭源模型(如 GPT-5.4)生成数据,缺乏面向智能体交互行为的轻量级训练方案影响函数纯化等高效数据筛选手段未被引入安全领域,难以用极少量样本驱动模型。
  • 部署开销过大:基于 Docker 的沙箱安全训练环境通常消耗大量计算资源,难以低成本融入大规模智能体训练流程;同时,生产环境缺乏免训练的在线安全护栏,无法实现实时风险拦截。

问题的重要性与技术挑战

智能体安全对齐的难度源于三点:

  • 风险复合性:智能体在多步交互中可能出现感知错误→错误动作→级联危害的复合故障,静态单轮安全检测难以捕捉。
  • 对齐效率:如何用约 1k 样本训练出与千亿参数闭源模型相匹敌的安全判别器,考验数据筛选、分类法引导与微调策略的协同设计。
  • 部署可行性:安全组件必须足够轻量,在 Docker 环境中将部署开销降低两个数量级,才能同时服务于离线微调与在线推理,满足“安全即服务”的实时性要求。

行业类比

这一挑战类似于为云原生微服务架构构建 Web 应用防火墙(WAF):既要理解多样化攻击向量,又要以极低延迟和嵌入式形态提供防护,并持续适应新交互模式。

核心洞察

  • - **数据效率驱动的 Agent 安全对齐范式**:AgentDoG 1.5 借助基于影响函数纯化(influence-function purification)的数据引擎,仅用约 1000 条样本即可训练小参数规模模型(0.8B-8B),达到与 GPT-5.4 等超大闭源模型可比的 agent 安全审计性能。这与以往依赖海量标注数据、百亿参数以上模型的 agent 安全对齐方法根本不同,显著降低了数据获取和模型训练成本,使安全对齐可规模化、可复现。
  • - **两阶轻量级部署将 Agent 安全训练成本压低两个数量级**:通过将 agent 安全 SFT 和 RL 训练环境合成为高效 Docker 镜像,AgentDoG 1.5 将部署开销降至传统方法的百分之一。这打破了现有 agent 安全框架因环境引擎笨重而无法迭代训练与大规模评测的工程瓶颈,使实时在线 guardrail 和持续安全微调成为可能,直接回应了开放世界 agent 对快速、敏捷安全响应机制的迫切需求。

方法

方法概览

AgentDoG 1.5 是一种轻量、可扩展的智能体安全对齐框架。它从安全分类法出发,通过小型精选数据训练紧凑模型,实现高性能安全守卫与高效的在线部署。

输入与分类法更新

面向现代开放世界智能体(如 OpenClaw),框架首先拓展了 agent 安全分类法,纳入 Codex 执行等新兴风险来源,定义风险源、失效模式和真实世界危害的层级结构。该分类法支持定制化机制,用于生成多样化的安全基准实例(ATBench)。

关键模块

  1. 分类法引导的数据引擎:基于更新分类法,从大量交互轨迹中采集候选数据,并引入 影响函数净化 (influence-function purification),从数千样本中筛选约 1k 个最具影响力的样本,减少冗余与噪声,实现数据高效利用。
  2. 轻量级监督微调 (SFT):使用精选的少量样本对 0.8B 至 8B 参数规模的预训练模型进行 SFT,使模型学习判断智能体行为的安全性(包括轨迹级安全评分与细粒度风险诊断)。
  3. 强化学习训练环境:构建一个极轻量的 agentic safety RL 环境,在 Docker 级别部署,将开销降低两个数量级,支持快速、粗粒度的安全奖励训练,提升模型在交互场景中的鲁棒性。
  4. 在线护轨 (Online Guardrail):训练后的 AgentDoG 1.5 可作为无需训练 (training-free) 的在线安全守卫,实时审查智能体的每一步动作,拦截不安全行为。

输出与效能

最终输出一个可部署的轻量模型,在多样化、复杂的交互式智能体场景中达到最先进安全性能,与 GPT-5.4 等闭源大型模型性能相当。所有模型与数据集均已公开。

与同类方法的差异:传统智能体安全框架通常依赖大规模数据训练、庞大模型或繁重的虚拟环境模拟,而 AgentDoG 1.5 通过影响函数数据提纯和轻量化 SFT/RL 设计,仅用 ~1k 样本和小尺寸模型,并在极其轻量的 Docker 环境中完成训练与部署,大幅降低计算与运维成本,同时保持高安全检测能力。

实验

实验设计

AgentDoG 1.5 的实验围绕三个层面展开:安全对齐能力训练环境效率在线护栏

  • 对齐训练:基于更新的安全分类法,构建ATBench 数据引擎,通过影响函数纯化精选约 1k 高质量样本,训练 0.8B–8B 四种参数的轻量变体。
  • 评估基准:在轨迹级安全、细粒度风险诊断多维度测试,覆盖 AgentHarm、AgentSafetyBench 等主流基准,并在 OpenClaw、Codex 等执行环境中验证。
  • 应用评测:用 AgentDoG 1.5 为 SFT 和 RL 过滤安全数据,并构建 Docker 级轻量 RL 环境,比较部署开销;同时测试其作为无训练的在线安全护栏。

关键发现

  1. 数据高效:仅靠千级样本,最小 0.8B 模型就能达到与 GPT-5.4 等闭源模型可比的轨迹安全水平,且风险诊断粒度更细。
  2. 环境轻量化:AgentDoG 1.5 驱动的 RL 训练环境将 Docker 级部署开销降低 两个数量级,显著提升安全训练的流水线效率。
  3. 在线护栏:无需微调部署,即可拦截交互中的实时风险,在多样化 Agent 场景中保持高召回与低延迟。

与基线对比深度解读

与传统 agent 对齐框架相比,AgentDoG 1.5 的突出差异在于 轻量性与可扩展性的统一。多数方案依赖大规模人工标注或复杂提示工程,而该框架通过分类法引导 + 影响函数筛选,实现了 数据精简且覆盖新型威胁(如 Codex 远程执行风险)。在 RL 训练支撑上,两数量级的环境开销缩减使得 Agent 安全迭代从“资源密集”变为“单机可行”,这为工业级部署扫清了成本障碍。但性能结论仅基于现有基准,对对抗性攻击的鲁棒性仍需进一步红线测试。

行业影响

落地场景与用例

AgentDoG 1.5 定位为 轻量级、可扩展 的智能体安全对齐框架,其典型落地场景覆盖所有依赖 AI 智能体进行复杂交互的产品线。核心场景包括:

  • 电商智能客服:当客服机器人处理退款、投诉等敏感对话时,AgentDoG 1.5 作为在线护栏实时审查回复,阻止诱导点击、泄露用户隐私或输出违规营销话术,避免品牌危机与合规风险。
  • 金融交易助手:在生成投资建议或执行交易时,框架可检测并过滤欺诈操纵、内幕交易暗示等不安全行为,确保输出符合监管要求。
  • 内容平台审核代理:集成到内容生成或分发智能体的输出端,对生成文本进行安全诊断,实时拦截仇恨言论、暴恐等内容,降低人工审核负载。
  • 企业级 RPA 与自动化代理:在跨系统操作(如 OpenClaw 环境)中,AgentDoG 1.5 可识别权限滥用、数据泄露等风险,保障自动化流程安全运行。

商业价值

AgentDoG 1.5 面向降本、增效、控险三条商业主线:

  • 大幅降低安全对齐成本:仅需约 1k 训练样本即可训练出与大型闭源模型性能相当的安全分类器,显著减少数据标注与算力开销;0.8B~8B 参数规模使推理部署成本极低,可替代昂贵的 GPT 级模型用于实时安全检查。
  • 提升产品安全与合规效率:通过两层应用(安全 SFT/RL 训练环境与在线护栏),企业可将安全对齐融入产品迭代流水线,缩短安全验证周期,降低上线后的事故风险与公关成本。
  • 加速产品上市:轻量环境部署开销减少两个数量级,开发者能在现有 Docker/K8s 基础设施中快速实验和上线安全特性,无需重构架构,推动安全智能体更快进入市场。

与现有产品/工作流的接口

AgentDoG 1.5 设计为 即插即用 模块,易于融入现有 MLops 栈:

  • 在线安全 API 接口:封装为 REST/gRPC 服务,接收智能体输入输出,返回安全评分及风险标签(遵循其分类体系),可像内容审核 API 一样被调用。
  • 训练环境集成:提供轻量级 Docker 镜像,可直接嵌入 CI/CD 管道,与常见的 RL 框架(如 RLlib)或 SFT 工具链结合,用于迭代式安全调优。
  • 监控与日志系统:输出结构化的风险诊断结果,可汇入 Prometheus/Grafana 等监控系统,构建安全看板与预警。

具体集成示例:在电商智能客服系统中,AgentDoG 1.5 部署为 sidecar 容器,通过 gRPC 与主对话引擎通信,对生成回复进行微秒级审查;当风险分超过阈值时,可降级为预设安全回应或转人工,实现业务零侵入防护。

局限

  • **安全分类法依赖**:框架依赖预定义的智能体安全分类法来指导数据构建与训练。尽管引入可定制机制,分类法本身可能无法涵盖所有新兴攻击模式(尤其长期自主智能体所产生的复合风险),且持续更新分类法需要领域专家频繁介入,限制了框架在高度动态场景下的自适应能力。
  • **小样本训练的泛化边界**:利用影响函数纯化将训练数据压缩至约1k样本,虽然显著降低训练成本,但数据的覆盖面和多样性可能被压缩,导致模型在面对训练分布外(OOD)的复杂对抗行为或新型交互模式时判别能力不足。论文并未提供对抗鲁棒性或长尾风险泛化实验。
  • **评估生态的局限性**:实验在现有基准(如ATBench系列)上取得与GPT-5.4可比的结果,但真实部署中的安全决策往往涉及多步因果推理与模糊判断,小模型(0.8B–8B)可能在这些场景中表现不如大型前沿模型。论文未分析模型在延迟、吞吐与安全之间的权衡,也未讨论在线护栏模式下因误拦截造成的可用性下降。
论文Dongrui Liu2026-05-28原文

相关内容