论文

GGSS: Geodesic-Gated Spherical Steering 用于生成式视觉-语言模型的推理时去偏

GGSS: Geodesic-Gated Spherical Steering 用于生成式视觉-语言模型的推理时去偏

生成式视觉语言模型(VLM)在以人为本的场景中应用日益广泛,但即使在图像仅存在感知种族、性别等受控属性差异时,其输出仍可能带有群体偏见。然而,现有推理时去偏方法主要针对静态嵌入或 CLIP 类模型设计,难以直接用于生成式 VLM。 为此,我们提出 GGSS(Geodesic-Gated Spherical Steering)——一种保范干预方法。它在单位超球面上发现反事实偏见子空间,沿测地弧引导视觉标记,并通过自适应门控将校正聚焦于携带更强人口统计信号的标记,从而实现高效的推理时去偏。 我们在四个生成式 VLM 上评估 GGSS,与十个改进的推理时去偏基线及提示式缓解方法进行对比,采用统一工作点协议,涵盖类别、成对和职业性别偏见测试,同时评测通用视觉语言能力。结果显示,GGSS 在四个模型上取得最低平均偏差,其中三个骨干模型通过配对置换检验显著优于基线,同时将 MMStar 精度保持在未引导基线的 ±0.6 个百分点以内。代码已开源。

论文精读

TL;DR GGSS 在单位超球面上沿测地线弧引导视觉 token,并通过自适应门控聚焦高偏差 token,在推理时去除生成式 VLM 的人口统计偏差,四个模型平均偏差最低且 MMStar 精度仅波动 ≤0.6 个百分点。

问题

问题背景

生成式视觉语言模型(VLM)如 LLaVA、InstructBLIP 已在图像描述、视觉问答等任务中广泛部署,但其输出可能随图像中感知种族、性别等属性产生系统性偏置,推理时去偏成为多模态公平性研究的热点。

现有方法局限

现有推理时去偏方法多为 静态嵌入 或 CLIP-like 对比模型 设计,如 INLP、LEACE、MeanDiff 等,主要存在以下技术限制:

  • 几何假设不匹配:这些方法通常假设嵌入空间为欧氏线性,采用线性投影或均值偏移消除偏置方向;但生成式 VLM 的视觉 token 经过多层 Transformer 交互,实际分布在单位超球面或高维流形上,欧氏操作会破坏 norm 约束或扭曲语义几何。
  • 缺乏 token 级选择性:现有方法大多对整层激活或全局嵌入统一修正,无法区分携带人口统计学信号的 token 与一般语义 token,容易过度修正无关信息,损害视觉语言保真度。

为什么这个问题难/重要

  1. 技术挑战:生成式 VLM 的偏置路径跨越视觉编码器、跨模态注意力与自回归解码,单纯在视觉嵌入或文本嵌入层做线性擦除难以有效阻断偏置;同时要在不重新训练、不牺牲通用能力的前提下实现可插拔去偏,对干预的几何性质与选择性要求极高。
  2. 业界关注:医疗影像报告、招聘简历筛选、教育内容生成等人本场景对模型公平性有监管与伦理硬约束,需要即用、可审计、性能无明显下降的推理时方案。

行业类比

这类似于在 推荐系统 中对用户表征进行事后公平性调整,但 GGSS 将球面几何约束和自适应门控引入了视觉 token 级干预,以保持生成质量。

核心洞察

  • GGSS 将推理时去偏定义为在单位超球面上沿测地线弧移动视觉 token,通过保范几何避免欧氏投影导致的信息幅度失真,并用自适应门控聚焦携带人口统计信号的 token。与 INLP、LEACE 等基于线性投影的概念擦除基线相比,球面更新更符合 VLM 中归一化 token 表示的流形结构,且不会破坏视觉语义完整性。
  • GGSS 把推理时去偏从 CLIP 风格静态嵌入扩展到生成式 VLM 的视觉 token 流,利用反事实图像对估计反事实偏置子空间,无需额外训练。相比 BendVLM 式检索均衡或 fairness-instruction prompt,它直接在视觉编码阶段修正因果信号,在四个骨干模型上实现最低平均偏置,同时保持 MMStar 精度波动在 ±0.6 个百分点内。

方法

输入

  • 一张待处理的图像,通过生成式 VLM 的视觉编码器提取一组 视觉 token(每个 token 对应图像区域特征)
  • 预计算的反事实偏差子空间与门控校准参数(离线发现)

关键模块

  1. 反事实偏差子空间发现

    • 构建反事实图像对(仅改变感知人口统计属性,如种族 / 性别,其余语义不变),提取视觉 token,计算 token 级差异向量
    • 在单位超球面上对差异进行球面 PCA(或 SVD),估计出一个低维正交子空间,编码人口统计偏差方向
    • 利用该子空间对所有 token 的投影分布,标定门控阈值与校准统计量
  2. 自适应门控

    • 对每个视觉 token,计算其在偏差子空间上的投影能量或相似度
    • 根据预校准的分布,输出一个 0-1 之间的门控权重,偏差信号越强的 token 权重越高,偏差无关 token 权重趋近 0
  3. Token 级测地线引导

    • 将每个 token 投影到偏差子空间,得到偏差分量;目标方向为去除该分量后的正交补方向(即零偏差方向)
    • 在单位球面上沿测地线弧将 token 从原始位置移动到目标方向,保持 token 的 L2 范数不变
    • 移动幅度由门控权重缩放,实现选择性校正

输出

  • 经范数保持的引导视觉 token,直接替换原始 token 送入 VLM 的后续交叉注意力层,不修改模型权重,也不影响文本 token

与同类方法的差异:GGSS 针对生成式 VLM 的视觉 token,在单位球面上进行范数保持的测地线几何干预,并通过自适应门控聚焦高偏差 token;而现有推理时去偏方法多为静态嵌入或 CLIP-like 模型的线性 / 欧氏空间修正,缺乏对 token 级几何与生成过程的适配。

实验

实验设计

评估四个生成式 VLM,对比 十个推理时去偏基线 和提示缓解,采用统一操作点协议,测试分类、成对、职业-性别偏置,并用 MMStar 评估通用视觉语言能力。

关键发现

  • GGSS 在全部四个模型上平均偏置最低
  • 三个骨干在配对排列检验下显著降低偏置
  • MMStar 准确率变化在 ±0.6 p.p. 内,保持通用能力

与基线对比

推理时去偏常以牺牲通用性能为代价,GGSS 通过 球面转向 + 自适应门控 定位高偏置 token,干预更精准;相比面向 CLIP 的静态嵌入方法,GGSS 适配生成式 VLM 的视觉 token 流,在偏置降低与能力保持之间取得更优平衡。

行业影响

落地场景

GGSS 作为推理时 去偏插件,适用于任何依赖生成式 VLM 的高风险或敏感场景。

  • 电商商品描述生成:用户上传不同肤色模特图片,模型应生成一致的商品属性描述,避免隐含种族或性别偏见。
  • 医疗影像报告辅助生成:在分析不同患者群体影像时,确保诊断建议不受人口统计特征干扰。
  • 内容平台自动审核与摘要:对图像生成中性文字描述,降低因偏见标签导致的合规风险。

商业价值

主要价值体现在风险控制 与体验提升:

  • 降本:无需重新训练或微调模型,即插即用,减少为每个新模型收集标注数据的高额成本。
  • 合规降险:在就业、信贷等受监管场景中,降低因模型输出偏见导致的诉讼与品牌损害。
  • 体验一致:用户看到更公平的输出,增强对 AI 产品的信任,尤其在全球化市场避免因文化差异放大偏见。

与现有工作流集成

GGSS 可直接嵌入现有推理服务 中:

  • 在模型视觉 token 层 添加 steering 步骤,无需改变模型架构。
  • 提供校准统计量 与α 门控 参数,可按业务敏感度调整去偏强度。
  • 可与提示工程 或后处理过滤 相结合,形成多层防御。

具体用例:某电商平台在生成商品标题和描述时,使用 GGSS 对商品图片的视觉 token 进行 steering,避免出现“女性适合家务产品”等刻板印象,提升品牌形象并降低广告审查风险。另一案例,某招聘平台使用 VLM 自动筛选简历照片与职位匹配度,GGSS 可消除对候选人性别或种族的外观偏见,确保公平就业合规。

局限

  • **反事实数据依赖**是 GGSS 的核心瓶颈。该方法需要成对的反事实图像(仅人口统计属性变化、其余保持恒定)来估计**偏差子空间**,这类数据的获取成本高且往往需借助生成模型合成,可能引入新的分布偏差。若反事实样本覆盖不足或属性标注不准确,子空间估计会退化,影响后续的**测地线引导**。论文未讨论反事实图像质量对去偏效果的敏感性,也缺乏在新属性上扩展的可行性分析,这限制了实际部署中的灵活性。
  • **实验评估范围与能力保持指标单一**。研究仅在四个生成式 VLM(未列明具体模型)上测试,偏差任务限于类别、成对和职业-性别三类,可能未覆盖更广泛的性别、年龄、宗教等维度。能力保持仅用 **MMStar** 一个基准,而对 VQA、图像描述、推理等更典型的视觉语言任务影响未知。此外,**α 参数**通过交叉拟合选择,增加了工程复杂度,论文未提供推理延迟对比,实时性存疑。
  • 与同类推理时去偏方法相比,GGSS 在**超球面**上执行 **测地线更新**并引入**自适应门控**,虽然提升了保真度,但增加了计算图复杂度。门控校准基于训练分布的统计量,当测试分布发生偏移(如新域图像、罕见人口统计组合)时,门控可能错误抑制有用 token,造成性能波动。论文未与更轻量的投影式去偏(如 LEACE)进行细致的效能-效率权衡分析,在低延迟场景下的可用性有待验证。
论文Yiqun Sun2026-08-26原文

相关内容