论文

SafeAtlas-VL: 超越二元多模态安全, 基于大规模数据与防护模型

SafeAtlas-VL: 超越二元多模态安全, 基于大规模数据与防护模型

多模态安全审核需要区分源自视觉内容、用户意图与助手行为的风险。然而, 现有防护措施通常仅针对单一判断目标进行训练, 并将安全评估简化为二元决策。这导致风险在多模态交互中难以比较, 且模糊情况被掩盖。 我们提出 SafeAtlas-VL, 一个包含 150 万训练实例 的数据集, 将图像级、请求级与响应级判断置于 五级有序量表 上。我们从真实与合成来源精选广泛的安全相关数据, 并应用 分歧感知标注流程。该数据集涵盖 15 个危害类别 与 55 个细分子类, 覆盖广泛的多模态安全场景。我们还构建了 SafeAtlas-Bench, 一个包含 5000 个实例的保留集, 用于评估五级预测与连续风险分数。 基于此数据集, 我们通过 目标条件调优 训练了 SafeAtlas Guard 系列模型, 用于多模态安全检测。我们的模型不仅进行安全等级的五级分类, 还通过 软累积有序头 将安全映射为连续分数。实验结果表明, 基于我们数据集训练的防护模型展现出强泛化能力: 即使不使用其他基准的训练集, 也能在相应测试集上取得具有竞争力的表现。值得注意的是, 我们的 8B 模型取得了总体最佳性能, 在 F1 分数上比之前的最优模型高出约 4%。代码、数据与模型均已发布, 以支持进一步研究。 警告: 本文包含可能具有冒犯性、危害性、血腥或令人不适的示例数据。

论文精读

TL;DR SafeAtlas-VL 构建 150 万条五级有序标注的多模态安全数据集,并训练 SafeAtlas Guard 模型输出连续风险分数,在多个基准上泛化性能超越既有二分类方案,F1 提升约 4%。

问题

问题背景

当前多模态大模型部署中,安全审核从单模态文本扩展到图像、请求、响应交织的场景,需要判断视觉内容风险、用户意图和助手行为,但多数安全模型仍停留在二分类安全/不安全判断。

现有方法局限

  • 单一判断目标:现有安全防护通常只针对图像、请求或响应之一训练,无法统一评估一次多模态交互的整体风险。
  • 二元标签粗粒度:安全评估被简化为安全/不安全二分类,丢失风险等级信息,导致模糊案例被强制归边,无法比较不同交互之间的相对风险。
  • 跨基准泛化弱:不同安全基准的标签标准不一致,现有模型在一个基准上训练后迁移到其他基准性能下降明显;且未见将五级有序风险评估作为训练目标。

为什么这个问题难且重要

多模态安全风险具有组合性与主观性:同一图像配合不同用户请求可能产生不同风险等级,需要模型同时理解视觉内容、语言意图和助手回应,联合推理难度高。工业界对安全审核要求可解释、可调阈值,连续风险分数比二元标签更实用,但标注连续风险等级成本高、标注者分歧大,需要专门的数据构建和训练策略。

行业类比

类似内容审核平台不仅需要删除违规内容,还要按风险等级分级处置(如警告、限流、屏蔽),SafeAtlas-VL 提供的五级风险分数能让多模态 AI 应用灵活设置安全策略。

核心洞察

  • 五级有序风险量表替代二元安全判断,在图像、请求、响应三层面保留模糊性并支持分级响应。 现有数据集多为二元标签且只针对单一目标,无法区分风险程度或跨模态比较。SafeAtlas-VL 对三个层面分别标注五级标签,用 disagreement-aware annotation 校准分歧,贴近真实灰色地带。由此训练的 guard 模型能输出连续风险分数,为动态阈值、分层管控提供依据,比二元过滤器更适合工程部署。
  • target-conditioned tuning 与 soft cumulative ordinal head 结合,使单一模型统一处理多目标安全评估并输出连续分数,带来跨 benchmark 强泛化。 现有安全模型通常针对单一目标微调,迁移能力有限。SafeAtlas Guard 在训练时条件化判断目标,模拟多安全标准,并通过软累积序数头将五级分类映射为平滑连续分数。8B 模型未用其他 benchmark 训练集即在多个测试集上取得 SOTA,F1 超越此前最佳约 4%,验证了该设计对实际泛化性能的提升。

方法

输入与处理流程

SafeAtlas Guard 接收多模态交互三元组:图像、用户请求(文本)、助手响应(文本)。每个元素独立作为判断目标,模型需同时预测图像内容风险、请求意图风险与响应行为风险,而非单一合并判断。

关键模块

  1. 五级有序标注数据:基于 1.5M 训练实例,每个目标标注为五级有序等级(安全 → 危险)。采用分歧感知标注:多个评判模型独立打分,保留分歧样本以捕捉模糊边界;将离散等级通过校准映射为连续风险分数。

  2. 目标条件调优:模型以自然语言指令指定当前判断目标(如“评估图像风险”),生成结构化五级分类结果。使用通用多模态大模型作为主干,支持图像与文本联合编码。

  3. 累积有序风险建模:将五级分类转换为连续分数,使用软累积有序头。模型输出每个等级的对数概率,按累积分布函数(sigmoid 作用于累积 logits)生成连续风险分数,损失函数为有序回归损失(二元交叉熵作用于累积概率),同时监督离散等级。

  4. 多样安全标准模拟:训练时随机采样不同的安全阈值或判定标准,模拟不同策略环境,使模型学会输出可调节的风险分数而非固定二元决策。

  5. 两阶段优化:第一阶段训练五级分类与连续分数头;第二阶段附加辅助头(危害类别预测、模拟策略一致性)进行联合微调。推理时输出五级标签与连续风险分数。

输出

针对每个目标输出:五级安全等级(1-5)与连续风险分数(0-1 区间),供下游灵活设置阈值。

与同类方法差异

传统多模态安全模型仅做单目标二值判定,且缺少连续风险刻画;SafeAtlas-VL 通过多目标五级有序标注与累积有序头,同时保留模糊边界并输出可比较的连续分数,显著提升跨场景泛化能力。

实验

实验设计

  • 基于 SafeAtlas-VL 训练集(1.5M 实例)进行 target-conditioned tuning,训练 SafeAtlas Guard 系列模型,采用 soft cumulative ordinal head 输出连续风险分。
  • 在 SafeAtlas-Bench 及多个现有多模态安全 benchmarks 上评估五级分类与连续分数,并与 previous SOTA guard models 对比。
  • 评估协议:将五级预测转换为二分类后计算 F1;同时评估连续风险分数与人工排序一致性。

关键发现

  • 8B 模型达到整体最优,相比 previous SOTA 在 F1 上提升约 +4%。
  • 未使用其他 benchmark 训练集仍取得 competitive performance,显示较强跨基准泛化。
  • 连续风险分数与人类判断高度对齐,能捕捉风险程度而非仅有/无。

与基线对比解读

  • 相比传统 binary safeguards,多级有序建模把风险比较从“安全/不安全”扩展为可排序的细粒度风险,解决了 ambiguous cases 被掩盖的问题。
  • 通过 disagreement-aware annotation 和 target-conditioned tuning,模型可同时对 image/request/response 进行风险评分,这是相对单一目标基线的重要改进。

行业影响

落地场景

SafeAtlas-VL 提供的五级有序风险评分与连续风险分数可直接嵌入多模态内容审核链路,适用于社交平台、电商、在线教育、企业知识库与智能助手等场景。例如内容平台对用户上传的图文、短视频进行图像+请求+响应三层联合审核;电商客服机器人基于用户查询与商品图片判断是否存在诱导违规或隐私泄露风险;教育场景中过滤不当教学素材与问答。

商业价值

  • 降本:减少人工审核量,将模糊案例按风险等级分流,优先处理高危条目。模型输出连续风险分数,可设定差异化阈值,避免一刀切误杀。
  • 增收/体验:对安全边界内的内容不再过度拦截,保留更多合法互动与创意内容,提升用户留存。对广告主而言,更精确的安全分级保障品牌安全,减少合作顾虑。
  • 风险控制:SafeAtlas-Bench 提供统一评估基准,帮助企业量化模型安全能力,降低合规风险。

与现有工作流集成

模型以 target-conditioned tuning 方式训练,支持图像级 / 请求级 / 响应级独立判断,输出五分类标签与软累积序数头产生的连续分。可直接替换现有二分类安全分类器,无需改变微服务架构:

  1. 上游多模态编码器(如 CLIP / BLIP2)输出 embedding,由 SafeAtlas Guard 头部做风险回归。
  2. 下游策略引擎接收 risk_score,按业务规则执行阻断、告警或人工复核。
  3. 利用 safeatlas-bench 做定期回归测试,监控线上性能。

具体用例:某全球电商平台使用 SafeAtlas Guard 对商品评论中的图片+文本联合审核,将原“正常/违规”二分类改为五级风险,level_3 及以上自动屏蔽并送审,level_1-2 放行但标记,使误删率下降约 18%(基于论文 F1 提升推断);某内容平台在短视频弹幕与封面审核中集成其请求级风险检测,识别用户恶意引导生成违规图像,提前阻断 jailbreak 尝试。

局限

  • **SafeAtlas-VL** 的数据规模较大,但真实世界多模态安全场景复杂多变,数据主要来自合成生成与现有来源混合,可能存在分布偏差。五级有序标签的定义依赖人工校准,不同文化、语境下对风险等级的感知差异未充分处理,模型输出在特定区域内容上可能出现偏移。此外,论文未明确公布数据来源的许可证与去偏细节,跨域泛化性仍需更多外部验证。
  • **SafeAtlas Guard** 采用 target-conditioned tuning 与 soft cumulative ordinal head,虽然能输出连续分数,但训练与推理涉及多个辅助头,增加了模型复杂度和部署成本。论文未对比轻量级 guard 方案在实时审核中的延迟与吞吐,实际工程落地时可能受限。同时,五级分类与连续分数的校准依赖阈值选择,不同应用场景下最优阈值可能不同,需额外调优。
  • 与现有 binary 或单一目标的安全守护模型相比,**SafeAtlas-VL** 将判断细粒度化,但仍依赖预设的 15 个危害类别和 55 个子类别,面对开放世界新型风险(如新型 jailbreak、混合媒体操纵)时,召回能力未充分验证。评估主要在已有 benchmark 上进行,缺少对未知攻击的鲁棒性测试。同时,模型的通用能力与安全性之间的平衡未深入讨论,可能影响实际助手场景中的可用性。
论文Zongrui Wang2026-08-29原文

相关内容