论文

FoMo: 生成轨迹中的分叉时刻作为感知距离

FoMo: 生成轨迹中的分叉时刻作为感知距离

Reference-based IQA 指标旨在反映人类对图像对之间感知距离的判断。为模拟 HVS 的工作方式,现有指标高度依赖人工标注:MOS 式逐点打分便于标注,但大规模采集成本过高,且因人类判断不一致而噪声较大;2AFC 成对标签可靠高效,却只捕捉成对之间的相对比较。 本文提出一套全自动数据生成流程,无需任何人工标注即可为图像对生成逐点感知距离标签。其思路是把 diffusion models 的生成动态当作感知距离的代理:图像在生成早期确定粗结构,在后期才生成细节;两图若在早期分叉,则只共享粗结构、感知上相距较远,若在后期分叉则仅细节不同。作者将这一分叉时刻称为 FoMo,用它作为有参考依据的距离标签,监督 reference-based IQA 指标的训练。 逐点标签支持任意图像对之间的通用比较,带来信息量更丰富的训练目标。在多种骨干架构上的大量实验验证了该生成流程的有效性,并在多个 benchmark 上超越了人工标注数据集的训练效果。

论文精读

TL;DR 提出 FoMo,将扩散模型生成轨迹中的分叉时刻作为感知距离标签,全自动生成点对点 IQA 训练数据,无需人工标注,且在多个基准上超越人工标注数据集。

问题

问题背景

参考图像质量评估(IQA)的核心目标是拟合人类视觉系统(HVS)对图像对之间感知距离的判断。目前主流方法依赖人类标注数据来训练度量模型,但标注的获取方式存在固有矛盾。

现有方法局限

  • MOS 点式评分 为每幅图像分配一个标量质量分数,语义上直接对应感知距离,但人工采集成本极高,且标注者主观差异引入大量噪声,难以大规模扩展。
  • 2AFC 成对比较 可靠性高、标注效率较好,但只能给出二元相对排序,无法直接得到任意图像对之间的绝对感知距离。这迫使模型学习序关系而非连续距离映射,信息利用率有限,且无法直接处理“任意图像对”的普适距离计算。

为什么这个问题难/重要

关键在于自动获得逐点(pointwise)且参考对齐的感知距离标签。需要找到一种与 HVS 感知结构一致的信号源。扩散模型的生成轨迹提供了一种可能:早期 timestep 决定粗粒度结构,后期塑造细节。若两幅图像在生成过程中“分叉”早,则仅共享粗结构,感知距离大;分叉晚则差异小。难点在于验证这种“分叉时刻”是否与人类感知距离在统计上对齐,并构建可扩展的生成 pipeline 来标注任意参考图像对,而无需任何人工介入。业界对可扩展、低成本、低噪声的训练数据获取方式有强烈需求,这直接影响 IQA 模型在下游任务(如图像超分、压缩、生成模型评估)中的泛化能力。

行业类比

类似用 语言模型的困惑度 或 扩散模型自身轨迹 作为质量/距离的自动监督信号,替代昂贵的人工评分,与自监督对比学习中利用数据自身结构构造正负样本的思路一致。

核心洞察

  • FoMo 将扩散模型生成轨迹中的分叉时刻定义为感知距离:两幅图像从同一起始潜变量演化,在时间步 t_fork 处分成不同分支,早期分叉仅共享粗结构,感知距离大;晚期分叉只差异细节,距离小。该定义与人类视觉系统对结构优先、细节后置的感知特性天然对齐。相比 MOS 点式评分和 2AFC 配对比较,它无需人工标注,且输出的是连续点式距离而非离散排序,能直接支持任意图像对比较,为 IQA 训练提供信息更丰富的监督信号。
  • 该工作提出全自动数据生成管线,利用 FoMo 合成具备精确感知距离标签的图像对,彻底绕开人工标注的高成本和噪声问题。传统 MOS 标注昂贵且不一致,2AFC 只捕获相对偏好;该管线通过控制轨迹分叉时刻,可大规模生成任意粒度差异的训练样本,并适用于多种 backbone。实验显示在多个 IQA 基准上超过人工标注数据集,证明合成点式感知距离标签是一种可行的替代方案,为数据驱动的感知度量学习开辟了新路径。

方法

输入与数据构建

输入为任意图像对,包括参考图像和待评估图像。方法核心通过扩散模型自动生成点级感知距离标签,无需人工标注。

关键模块

  1. 扩散轨迹分叉点检测
    利用预训练扩散模型对图像对进行重建或生成。在生成过程中,早期时间步负责粗粒度结构(如物体轮廓、全局布局),后期时间步生成细节纹理。当两幅图像的生成轨迹在早期就发生显著分歧(FoMo),说明二者仅共享粗结构,感知距离较大;若分叉发生在后期,则仅细节不同,感知距离较小。

  2. 点级距离标签映射
    将分叉时间步(trajectory divergence)转换为一个标量感知距离值。该过程完全自动化,能够以极低成本构建大规模训练数据集,且标签连续、可跨任意图像对比较。

  3. IQA 模型训练
    采用参考型骨干网络(如 Transformer 或 CNN),以参考图像和失真图像作为输入,输出预测的感知距离。训练使用回归损失,使预测值逼近 FoMo 导出的目标距离。为保持对称性,对 Transformer 骨干网络做了特殊处理,确保 d(ref, dist) 与 d(dist, ref) 一致。

输出

输出为一个可对任意图像对给出连续标量感知距离的参考型 IQA 模型,支持通用比较。

相比传统 MOS(点级但昂贵且噪声大)和 2AFC(仅相对排序),FoMo 首次实现全自动生成信息丰富的点级连续标签,训练信号更强,且在多基准上超越人类标注数据集训练的效果。

实验

实验设计

论文提出 FoMo 数据生成管线,利用扩散模型生成轨迹中的分叉时刻作为感知距离标签,无需人工标注。实验在多种骨干架构上训练参考型 IQA 指标,并与基于人类标注的数据集进行对比,评估采用多个标准 IQA 基准。

关键发现

实验结果表明,FoMo 生成的 pointwise 标签具有丰富信息,训练出的指标在多个基准上超越了使用人类标注数据训练的模型。作者强调扩散轨迹与人类视觉系统对齐良好:早分叉对应粗结构差异,晚分叉对应细节差异,因此分叉时刻可作为可靠的感知距离代理。

基线对比解读

相较于 MOS 点标注和 2AFC 成对标注,FoMo 无需人工,且能提供任意图像对之间的标量距离,支持通用比较。这解决了人工标注成本高、噪声大的问题,同时避免了成对标签只提供相对序的局限。在多种骨干上的一致性验证了流水线的鲁棒性,显示出自动化标注在参考型 IQA 任务中的潜力。

行业影响

落地场景

FoMo 核心是自动生成成对图像的感知距离标签,无需人工标注,可直接用于训练参考图像质量评估 (IQA) 模型。典型落地场景:

  • 内容平台审核:视频 / 图像平台用 IQA 自动过滤低质量上传内容,或评估压缩 / 增强算法的感知保真度。
  • 电商图片优化:自动评估商品图在不同后处理 (如超分、去噪) 下的感知质量,优选出视觉最佳的图片,提升点击与转化。
  • 医疗影像质控:在影像采集或重建流程中,实时评估参考图与生成图的感知差异,辅助判断设备状态或算法性能。
  • 自动驾驶传感器数据筛选:对摄像头采集帧进行质量评估,剔除模糊、噪声严重的样本,提升下游感知模型训练数据质量。

商业价值

主要降本与体验提升双线并行:

  1. 降本:传统 MOS 标注昂贵且噪声大,2AFC 只能提供相对排序。FoMo 用扩散轨迹自动生成点wise 标签,数据成本趋近于零,同时避免众包标注的不一致性。
  2. 体验提升:点wise 标签支持任意图像对比较,训练出的 IQA 模型泛化更强,可在更多业务场景稳定输出质量分数,驱动自动优化链路 (如自适应码率、图像增强参数调整)。

跟现有产品 / 工作流的接口

FoMo 可作为数据生成模块接入现有 IQA 训练流水线:

  • 数据侧:给定参考图像,利用扩散模型生成多组不同分叉时刻的配对图像,自动产出 (ref, dist, perceptual_distance) 三元组。可结合现有的 LPIPS / DISTS 等传统 IQA 度量作为基线标签对比,或直接替换人工标注数据集 (如 KADID-10k、PIPAL) 进行监督训练。
  • 模型侧:标签格式与点wise 回归目标兼容,可无缝替换现有 IQA 模型的损失函数 (如 MSE / RankNet)。对于已有 IQA 模型 (如 DISTS、LPIPS 的深度学习版本),只需更换数据加载器,即可用 FoMo 生成的大规模数据微调。
  • 工程注意:扩散模型推理成本较高,需在离线批量生成与在线实时需求之间权衡;建议用缓存机制存储高频参考图的生成轨迹分叉点。

具体 use case:某电商平台需对每日百万级上新商品图自动评估清晰度与感知质量。传统方案依赖人工抽检或简单清晰度算法,误判率高。使用 FoMo 离线生成数千万对 (参考图, 扰动图, 感知距离) 训练专用 IQA 模型,部署后实时输出质量分,低于阈值自动触发重新拍摄或增强流程,节省人力并提升商品图一致性。

另一场景:视频流媒体平台需评估不同编码参数下画面质量,FoMo 可生成压缩失真数据集,训练轻量 IQA 模型嵌入编码器决策环,实现感知驱动的动态码率分配。

局限

  • **生成标签的可靠性仍依赖扩散模型本身**。FoMo 使用扩散模型生成轨迹的分叉时刻作为感知距离代理,但该代理的准确性高度依赖所选扩散模型对图像结构语义的建模能力。对于域外内容、非自然图像或特定失真(如严重噪声、压缩伪影),生成过程可能无法正确区分粗结构与细节,导致分叉时刻与人类感知距离的映射产生偏差。论文中未系统评估不同扩散模型架构、训练数据分布对标签质量的影响,在实际部署时需要额外验证。
  • **缺乏与 MOS 的直接对齐验证**。论文主要使用 2AFC 或基准指标验证生成标签训练出的 IQA 指标,但未充分证明所得 pointwise 距离与人类 MOS 分数具有线性或单调相关性。由于 MOS 本身噪声大且昂贵,自动标签的价值在于替代 MOS,若不能与 MOS 良好对齐,则难以在需要绝对质量评分的场景(如视频编码、图像增强定量评估)中实际使用。
  • **计算成本可能限制大规模应用**。为构造训练对,需要从同一初始噪声出发生成多条部分共享轨迹,并在不同 timestep 分叉,这意味着成倍的扩散模型采样开销。对于高分辨率图像或大规模数据集,生成成本可能远超传统人工标注或现有 2AFC 数据收集方式,且论文未提供与数据量相关的效率分析,工程落地时需要权衡生成预算与标签增益。
论文Jaihyun Lew2026-09-22原文

相关内容