Learning Steadily: Accumulating Relative Point Margin Scores for Face Image Quality Assessment
面部图像质量评估(FIQA)旨在判断采集到的人脸图像是否适用于自动人脸识别(FR)。现有与 FR 集成的 SOTA FIQA 方法存在时间不稳定问题:特征空间在训练中不断演化,单轮次质量估计随之波动,形成「移动靶点」,损害了质量预测的可靠性。 本文提出 CARPM-FIQA,一种面向 FR 集成 FIQA 的稳定化策略:它在整个训练轨迹上累积相对点间隔(relative point margin,即类内紧凑度与类间分离度的比值)的测量值,而非依赖单轮次估计。该累积平均方法具有理论支撑的优势:降低质量估计方差、改善均方误差、提升排序稳定性,并随训练推进具备收敛保证。 在带质量组标签的 SynFIQA 数据集上,受控实验表明累积平均取得更强的判别能力;不同训练配置下的消融研究也验证了一致提升。在八个挑战性基准、四种 FR 模型、两个 FMR 阈值下与十二种 FIQA 方法对比,CARPM-FIQA 按跨 FR 模型的 pAUC-EDC 与 AUC-EDC 均值(及逐基准归一化后)在 17 种方法中分列第 4(CARPM-FIQA(L))与第 6(CARPM-FIQA(S)),对每个 FR 模型均与最佳方法的归一化均值相差仅几个百分点。 总体而言,该工作为训练不稳定提供了有原则的解决方案,同时保留 FR 集成的性能优势,并表明时间聚合策略可稳定深度学习中因特征表示演化而目标值本身波动的训练目标。
论文精读
TL;DR 针对人脸识别集成 FIQA 的质量估计随训练波动问题,CARPM-FIQA 通过累积整个训练轨迹的相对点边界测量稳定质量分数,在多项基准上取得领先且更稳定的表现。
问题
问题背景
Face Image Quality Assessment (FIQA) 是生物识别系统可靠性的关键前提,当前研究聚焦于将 Face Recognition (FR) 模型的特征空间信息直接集成到质量预测中,以提升质量评估与识别性能的相关性。
现有方法局限
主流的 FR-integrated FIQA 方法依赖单一时点的特征空间计算质量标签,但 FR 模型在训练过程中特征空间持续演化,导致:
- 同一图像在不同 epoch 的质量估计大幅波动,形成 移动目标,破坏训练稳定性;
- 单 epoch 估计噪声大,方差高,质量排序不可靠;
- 无法为下游任务提供收敛一致的质量监督信号。
为什么这个问题难/重要
特征空间的演化是 FR 训练的固有属性,任何单点采样都无法消除时间维度上的不稳定性。要获得稳定质量估计,必须跨训练轨迹聚合信息,但简单平均会丢失类别间/类内关系的动态变化。该问题直接影响 FIQA 方法的泛化性 与 训练收敛性,在门禁、支付等对误识别率敏感的场景中尤为关键。业界对稳定、可解释的质量评估需求持续上升。
行业类比
类似于 自监督学习 中通过 动量编码器 或 EMA 平滑变化的表征来获得更稳定的目标,FIQA 也需要对演化中的特征空间进行时间聚合。
核心洞察
- 用累积平均替代单 epoch 估计,解决 FR-integrated FIQA 训练中因特征空间演化导致的质量标注漂移问题。与现有方法直接使用单个训练时刻的预测质量不同,CARPM-FIQA 在整个训练轨迹上累积相对点边际分数,从而降低估计方差并提升排序稳定性。这种时间聚合策略不仅适用于 FIQA,更为深度学习系统中目标值随特征表示变化而波动的场景提供了通用稳定化思路。
- 以相对点边际(类内紧凑性与类间分离度的比值)作为质量度量,比常用的绝对距离或分类置信度更能反映样本在特征空间中的真实可分性。累积平均后的相对点边际具有理论上的 MSE 改进和收敛保证,在 SynFIQA 数据集中表现出更高的判别能力;在多个基准上接近最优方法,说明该指标在 FR 集成质量评估中具备鲁棒性和可移植性。
方法
核心思路
CARPM-FIQA 的核心是将 FR-integrated FIQA 的质量估计从单一 epoch 快照改为 训练全程的累积平均,以消除特征空间演化带来的不稳定性。
输入 → 关键模块 → 输出
- 输入:训练中的 FR 模型(backbone + 分类头/度量学习目标)及一批人脸图像。
- 关键模块:
- 逐 epoch 计算相对点边际(Relative Point Margin, RPM):对于每张人脸图像,用当前 FR 特征提取器映射到特征空间,计算其 类内紧凑性(样本到同类中心的距离)与 类间分离度(样本到最近异类中心的距离)之比。该比率反映该样本在当前特征空间中的判别难度,作为质量信号。
- 累积平均(Cumulative Averaging):将每个 epoch 得到的 RPM 分数进行简单平均或指数移动平均,得到随训练迭代不断更新的稳定质量估计。论文证明了这种累积平均能降低估计方差、改善均方误差,并在训练收敛时保证排序稳定性。
- 输出:输入图像最终的质量分数,可直接用于 FIQA 排序或质量分级。
与同类方法的差异
与现有 FR-integrated FIQA 方法(如使用训练最后一个 epoch 或固定 checkpoint 的特征空间计算质量)不同,CARPM-FIQA 通过累积整个训练轨迹的 RPM 分数,把原本时变的“移动目标”转化为收敛的稳定目标,在不牺牲 FR 集成性能的前提下显著提升了质量预测的可靠性。
实验
实验设计
- 受控实验:在 SynFIQA 数据集(含标注质量组)上验证累计平均的判别能力,消融研究覆盖不同训练配置。
- 大规模评估:8 个挑战性基准、4 个 FR 模型、2 个 FMR 阈值,与 12 个 FIQA 方法对比(合计 17 个方法),使用
pAUC-EDC与AUC-EDC指标,报告按 FR 模型平均与按基准归一化平均结果。
关键发现
- 在 17 个对比方法中,CARPM-FIQA(L) 排名第 4(按
pAUC-EDC与AUC-EDC平均),CARPM-FIQA(S) 排名第 6。 - 每个 FR 模型上,归一化平均与最佳方法的差距保持在几个百分点以内,显示跨模型一致性。
- 理论分析表明累计平均降低质量估计方差、改善 MSE、提升排序稳定性并具有收敛保证。
与基线对比解读
- FR-integrated FIQA 普遍存在单 epoch 估计波动问题,CARPM 通过全程累计平均消除移动目标,与依赖单 epoch 快照的方法形成根本差异。
- 虽未取得绝对第一,但排名稳定性与跨模型一致性是更可预测的工程特性,适合部署中对质量分数随时间漂移敏感的场景。
- 该方法可视为训练稳定化插件,不改变 FR 主线结构,便于集成到现有 FIQA 流程。
行业影响
落地场景
人脸识别系统在 金融支付(如刷脸支付)、远程身份验证(KYC / eKYC)、智能门禁、视频监控 等场景中,图像质量直接决定识别成败。CARPM-FIQA 可作为实时质量过滤器:在采集端或后端对每一帧人脸图像评分,低于阈值的样本直接拒绝或引导用户重新采集。例如,在移动端开户流程中,FIQA 模块可避免因模糊、遮挡、光照差导致的识别失败;在监控视频流中,可自动筛选高质量帧用于后续 1:N 检索,降低误报和漏报。
商业价值
采用 CARPM-FIQA 可显著降低 误拒绝率(FRR) 和 误接受率(FAR),减少人工审核和用户重试成本。由于累积平均策略稳定了质量分数,部署后的质量判断不会因 FR 模型微调或特征空间漂移而波动,提升系统长期可靠性。对比其他 FR-integrated FIQA 方法,CARPM-FIQA 在 pAUC-EDC / AUC-EDC 等指标上接近最优,且无需额外质量标注数据,训练成本低。对需要大规模身份认证的服务商,可减少因低质量图像带来的客服压力和交易流失。
与现有工作流接口
CARPM-FIQA 可直接嵌入现有 人脸识别流水线,位于人脸检测与特征提取之间。它复用已训练好的 FR 模型 计算 relative point margin,无需单独训练质量回归网络;训练时以累积平均替换单 epoch 点估计,可与 MagFace、CR-FIQA 等 FR-integrated 方法结合,作为其稳定化补丁。代码简单,仅需修改质量分数的聚合逻辑,即可接入 TensorFlow / PyTorch 推理服务。
局限
- **累积策略引入额外存储与计算开销**。CARPM-FIQA 需要在整个训练轨迹上累积相对点边际分数,这意味着必须保存每个 epoch 的特征表示或质量中间量。论文未对额外内存占用和计算成本进行定量分析,实际部署到大规模人脸识别训练时可能面临资源限制。对于动辄数十万身份、数百万样本的工业级 FR 训练,累积全部中间状态并不现实,需要设计滑动窗口或衰减机制,但此类近似可能削弱理论上的方差降低效果。
- **实验设置主要依赖合成质量分组数据**。核心验证在 SynFIQA 数据集上进行,质量标签来自合成扰动,虽然便于控制变量,但真实场景中人脸图像质量退化模式更复杂(如运动模糊、极端光照、遮挡),累积平均对真实分布的泛化能力未经检验。此外,与 12 种方法的对比中,CARPM-FIQA(L) 和 CARPM-FIQA(S) 仅排名第 4 和第 6,距离最佳方法仍有几个百分点差距,说明累积平均并非全面超越,而是一种偏向稳定的折中方案,在追求极致性能的场景下可能被更激进的方法取代。
- **对 FR 模型训练前期的敏感性与超参依赖性未充分讨论**。相对点边际的定义基于类内紧凑性与类间分离度的比值,这依赖于 FR 模型已经学习到有意义的特征嵌入。在训练早期,特征空间尚未稳定,相对边际可能噪声极大,累积平均同样会受到这些异常值的污染,尽管长期收敛有保证,但短期内可能不如其他自适应更新策略。论文未系统研究学习率、batch size、优化器选择等关键超参数对累积效果的影响,也未与滑动平均、指数加权平均等简单时序聚合方法进行直接比较,削弱了其作为通用稳定化策略的可信度。