通过随机 Hessian 估计实现全参考图像质量指标的率失真优化
基于块的视频编解码器通过优化率失真权衡,依据输入选择编码参数。传统的失真选择 SSE(sum of squared errors)可简化参数选择:SSE 是各块 SSE 之和,因此 RDO 能够独立处理各个块。 而 MS-SSIM、LPIPS 等全参考图像质量评价(FR-IQA)指标通常比 SSE 更符合人眼视觉系统,却无法用于环内:它们不可按块分解,且通常需要完整解码图像作为输入。 本文基于已有的度量二次化结果,用 IDQD(输入相关二次失真)近似一大类 FR-IQA 指标,其二次型矩阵由该度量在源视频处计算的 Hessian 导出。为使失真可按块计算,作者提出两种 Hessian 矩阵近似: 1. 保留块对角; 2. 仅保留对角线。 两者的估计量都只需与自动微分得到的 Hessian 做矩阵-向量乘积。 在 VVC 中针对 Kodak 和 CLIC 的五个指标,IDQD-RDO 在目标指标下实现 14.2-36.7% 的 BD-rate 增益,无需解码器改动,编码复杂度开销为 10-30%。
论文精读
TL;DR 用随机Hessian估计将全参考图像质量指标二次化为可逐块计算的失真,让VVC编码器直接优化MS-SSIM/LPIPS等感知指标,BD-rate节省最高36.7%,无需解码器改动。
问题
问题背景
视频编码的率失真优化(RDO)中,失真度量选择直接影响压缩效率与视觉质量。目前主流编码器(如 VVC)仍以 SSE 作为默认失真,因为它具有可加性,能实现块级独立优化。但随着感知质量评价研究深入,SSE 与人眼主观感受的偏差成为显著痛点。
现有方法局限
- SSE 的感知缺陷:
SSE假设像素误差独立且等权重,对结构性失真、纹理变化不敏感,容易产生模糊或块效应却评分良好。 - FR-IQA 指标难以集成:
MS-SSIM、LPIPS等指标需要完整解码图像作为输入,且不具备块级可分解性,无法直接用于编码器内部的参数决策。传统做法要么事后评估,要么通过迭代解码反馈,导致复杂度剧增或无法实时。 - 二次近似挑战:已有工作尝试将 FR-IQA 二次化,但 Hessian 矩阵是高维稠密的,直接计算和存储不现实,块级分解困难。
为什么这个问题难/重要
- 技术难点:需要在不改变解码器标准的前提下,将全局感知失真近似为块级可计算的二次形式,同时控制 Hessian 估计的计算开销与统计误差。
- 业界关注度:视频编码标准(
VVC、AV1)持续追求更高压缩效率,而感知优化是下一代编码器竞争焦点。若能在不增加解码器负担的情况下,用感知指标指导编码决策,可显著提升相同码率下的主观质量,直接节约带宽和存储成本。 - 工程价值:本文提出的
IDQD-RDO在多个指标上实现 14.2–36.7% 的BD-rate节省,编码复杂度仅增加 10–30%,证明该方向具备实用潜力。
行业类比
类似于视频超分辨率或图像增强任务中,用可微感知损失替代 L1/L2 损失,但往往只能在训练阶段使用;本文工作相当于把这种“感知损失”成功嵌入到编码器的在线决策回路中,且不改变解码端。
核心洞察
- 核心洞察:利用 Hessian 将不可分解的 FR-IQA 指标转化为输入依赖的二次失真(IDQD),使其能够融入块级 RDO。传统的帧级感知指标(如 MS-SSIM、LPIPS)需要完整解码图像且不满足块级可加性,无法直接用于编码器内的率失真优化。本文利用指标在源视频处的 Hessian 矩阵构建局部的二次近似,该二次型可以在块级别独立计算,从而允许 VVC 等标准编码器在闭环中直接优化这些感知指标,且无需修改解码器。这与以往采用代理损失或迭代优化的方法有本质区别,因为 IDQD 保留了原始指标的二阶结构信息,而不是简单的加权 SSE。
- 核心洞察:随机 Hessian 估计通过矩阵-向量乘积避免显式构建 Hessian,使得高分辨率视频上的在线估计可行。对于高维图像,完整 Hessian 矩阵存储和计算不可行。本文提出的估计器仅需自动微分提供的 Hessian-向量乘积,即可估计 Hessian 的对角线或块对角线部分,显著降低计算和内存需求。这种随机估计方法利用了 Hessian 的稀疏结构假设,在精度与效率之间取得平衡。相比直接计算完整 Hessian 或使用有限差分近似,该方法可以在编码过程中实时运行,且被实验证明对 RDO 性能影响很小,是工程落地的关键。
- 核心洞察:实验证明该方法对多种 FR-IQA 指标具有通用性,在 VVC 中取得显著 BD-rate 节省且编码复杂度增加可控。作者在 Kodak 和 CLIC 数据集上测试了五种指标(包括传统 SSIM 变体和学习型 LPIPS),IDQD-RDO 相对于 SSE 基线在目标指标下实现了 14.2-36.7% 的 BD-rate 节省,同时编码复杂度仅增加 10-30%。这验证了二次化方法不依赖于特定指标的函数形式,只要指标可微,就能应用。与以往针对单一指标定制优化方法的工作相比,这种通用框架降低了将新感知指标集成到编码器中的门槛,为标准化编码器采用更符合人类视觉的失真度量提供了实用路径。
方法
方法核心是将不可块分解的全参考图像质量评价指标(FR-IQA)通过二次化近似为可逐块计算的失真函数。输入为源视频帧、候选重建块和目标 FR-IQA 指标(如 MS-SSIM、LPIPS)。关键模块如下:
- 度量二次化:在源视频处对指标做二阶泰勒展开,得到输入依赖的二次失真(IDQD),其二次型矩阵为指标在源视频处的 Hessian。原始指标被近似为块误差的二次加权和,权重来自 Hessian。
- 随机 Hessian 估计:为避免显式计算大 Hessian 矩阵,利用自动微分计算 Hessian 与随机向量的乘积(Hessian-vector product),通过随机估计器估计 Hessian 的块对角或纯对角部分。两种近似:保留 block-diagonal 或仅 diagonal,使失真可分解为各块独立贡献。
- 标准兼容集成:将 IDQD 替代 SSE 作为 RDO 的失真项,在 VVC 中对每个编码块独立优化参数,无需修改解码器。
输出为每个块的最优编码决策,使得在码率约束下目标指标近似最优。与需要全解码图像的迭代式 FR-IQA 优化不同,本方法通过随机 Hessian 估计实现块级分解的二次失真,可直接在编码器内使用。
实验
实验设计
在 VVC 参考编码器上,对 Kodak 与 CLIC 数据集开展实验,覆盖五个 FR-IQA 指标(如 MS-SSIM、LPIPS 等)。以传统 SSE RDO 为基线,评估 IDQD-RDO 在目标指标下的 BD-rate。关键设计:只修改编码端 RDO 过程,保持解码器不变;Hessian 矩阵经 自动微分 获取,块对角/对角估计器仅需矩阵-向量乘积。
关键发现
IDQD-RDO 在目标指标上取得 14.2-36.7% 的 BD-rate 节省,表明基于 Hessian 的输入依赖二次失真能更准确地指导编码参数选择,同时编码复杂度增加 10-30%,处于可接受范围。无解码器改动意味着与现有码流完全兼容,利于实际部署。
与基线对比解读
传统 SSE RDO 隐含假设各像素独立且等权重,忽略感知结构;IDQD-RDO 通过 Hessian 捕捉局部感知重要性,将 FR-IQA 近似为可分的二次型,保持分块优化能力。相比需要迭代重建或解码器感知的其他方法,本文方案编码端开销小,且无需改变码流结构,在工程上更易落地。
行业影响
落地场景
视频编码服务、流媒体平台、云游戏、视频会议等对带宽和感知画质敏感的业务可直接应用。该方法无需解码端改动,适合现有视频基础设施的渐进升级。
商业价值
- 降本:在同等感知质量下降低码率,BD-rate 节省 14.2-36.7%,可显著降低 CDN 带宽与存储成本。
- 体验提升:使用 MS-SSIM、LPIPS 等感知指标替代 SSE 进行编码优化,更符合人眼视觉,减少块效应等伪影,提升用户观看体验。
- 零兼容风险:不改动解码器,码流标准兼容,可平滑部署到现有终端生态。
与现有工作流接口
- 集成进编码器 RDO 模块:只需在编码端通过自动微分计算 Hessian 矩阵向量积,构造输入依赖的二次失真(IDQD),替换传统 SSE 失真度量。
- 支持 VVC 标准,可扩展到 HEVC、AV1 等编码器;计算开销增加 10-30%,适合离线转码与实时编码(可通过 GPU 加速)。
具体落地 use case
- 内容平台视频转码:流媒体服务商在服务端转码时使用 LPIPS 加权失真,同等码率下画质更优,或保持画质降低码率,直接节省带宽成本。
- 云游戏实时编码:云游戏对延迟和画质敏感,使用感知质量度量优化编码,可在保证流畅度的前提下减少带宽消耗,提升移动端游戏体验。
局限
- - **编码复杂度与实现门槛**:虽然摘要称仅增加 10-30% 编码复杂度,但这是在 VVC 参考软件上的相对开销,实际产品级编码器(如 x265、硬件编码器)集成自动微分 Hessian 矩阵向量积并不直接,可能需要额外工程适配。此外,随机 Hessian 估计引入的噪声可能影响 RD 决策稳定性,在高吞吐或实时编码场景下,额外延迟和计算负荷可能不可接受。论文未与轻量级感知优化代理(如基于 CNN 的失真预测)进行复杂度-性能权衡对比,难以判断是否值得投入。
- - **评估范围限于帧内图像编码**:实验仅使用 Kodak 和 CLIC 静止图像数据集在 VVC 帧内模式下测试,未覆盖实际视频序列的帧间编码。帧间预测会引入时域依赖,block-wise 独立假设与 block-diagonal/diagonal Hessian 近似可能偏离更远,导致 RD 优化性能下降或需要额外时域约束。此外,仅验证了五个 FR-IQA 指标(MS-SSIM、LPIPS 等),未包含 VMAF 等更复杂或混合模型指标,限制了结论的普适性。
- - **二次近似与 Hessian 简化的固有局限**:IDQD 基于源视频处的二阶 Taylor 展开,当量化失真较大(高 QP)时,二次近似与实际感知度量的偏差可能显著增加,导致 RDO 选择次优参数。block-diagonal 与 diagonal Hessian 近似忽略了块间感知交互,例如纹理掩蔽、全局对比度等跨块效应,可能无法完全捕获 FR-IQA 的全局特性。此外,方法要求编码端可获得源视频,对于无源参考或分布式编码场景不适用。