论文

无需梯度进行适配:仿射统计迁移及其证书能告诉你什么

无需梯度进行适配:仿射统计迁移及其证书能告诉你什么

测试时适配(TTA)通常假设推理时可更新模型参数。然而,对于仅推理加速器、冻结或第三方模型以及内存受限部署,该假设过于严格;且标准基于 BatchNorm 的 TTA 配置在无 BatchNorm 的架构上可能失效。 本研究聚焦于模型冻结下的适配问题,提出 CASTER——一种无梯度方法:它在判别子空间中存储源域类统计量,利用目标批次的矩估计类共享仿射变换,并在分类前解析式地迁移源类分布。CASTER 无需反向传播、优化器状态或源特征库。在 4 个骨干网络、7 个数据集上,CASTER 在冻结特征上与 k-NN 相比,于 28 个骨干-数据集设定中的 27 个上取得更优表现,且状态量中位数减少 18 倍。 然而,仿射迁移并非总是可靠。在 ImageNet-C 上,当批次仅含 64 个样本却覆盖 1000 类时,无条件迁移导致 top-1 精度下降 21.2 个点。为此,我们引入经验性的残差-间隔迁移性证书。在 307 个评估单元中,所有损失超过 10 个点的迁移其证书值均高于 3.9,尽管良性情况与破坏性情况并非完全可分。通过门控,无条件迁移的平均 -3.35 点 效应转为 +1.69 点 增益;在较大阈值范围内,性能与最优阈值相差保持在 0.3 点内。 此外,我们证明该证书是机制特定的:当应用于 Tent 时,它仅接受 4.3% 的更新,却保留 Tent 可用增益的 0.6%。这些结果表明 CASTER 是冻结模型部署的轻量级适配机制,并清晰说明其安全信号何时有效、何时无效。

论文精读

TL;DR CASTER 为冻结模型提供无需梯度的测试时自适应:用判别子空间统计估计仿射变换搬运源类分布,并通过可迁移性证书门控避免退化,性能优于 k-NN 且状态占用极低。

问题

问题背景

测试时自适应(TTA)旨在推理阶段缓解分布偏移,主流方法通过反向传播更新模型参数(如 Tent、SAR)。但许多部署场景要求模型完全冻结,且参数更新在边缘推理加速器上不可行。

现有方法局限

常规 TTA 依赖可微目标(熵最小化等)更新 BN 层,存在三个关键限制:

  • 参数更新假设:要求推理时保留计算图并执行反向传播,对只读加速器、第三方预训练模型或内存受限设备不友好。
  • BN 依赖:BatchNorm 统计量是多数 TTA 的核心,但 ViT 等无 BN 架构下方法失效。
  • 状态开销:梯度方法需维护优化器状态;k-NN 等冻结特征方法需要存储源特征库,内存随类别数线性增长。

为什么难且重要

当模型完全冻结且无梯度时,适配只能依赖特征空间的统计变换,但高维统计估计在小批量目标数据上极不稳定(ImageNet-C 批大小 64、类数 1000 时无条件运输掉点 21.2%)。因此既要设计高效的无梯度变换,还要给出可传输性证书判断何时该用变换,否则“适配”可能反而损害性能。业界越来越关注边缘推理、模型即服务等无法触碰权重的场景,这类轻量安全适配机制成为刚需。

类比:类似通过 API 调用黑盒视觉模型,服务方不允许微调权重,但用户本地可对输入特征做统计对齐,以适配特定光照或天气条件。

核心洞察

  • - **无梯度仿射统计运输**:CASTER 在冻结模型下,仅存储源类判别子空间统计量,通过目标批次矩估计类共享仿射变换,解析地运输源类分布,无需反向传播与优化器状态。相比 k-NN 在相同冻结特征上,其在 28 个骨干-数据集组合中 27 个胜出,且状态开销中位数降低 18 倍;相比梯度 TTA,它摆脱了对参数更新的依赖,适用于推理专用加速器与第三方模型部署。
  • - **可运输性证书的门控作用**:论文提出经验残差边际可运输性证书,用于判断仿射运输是否安全。在 307 个评估单元中,所有损失超过 10 个点的运输证书值均高于 3.9,门控将无条件运输的平均 -3.35 点效果扭转为 +1.69 点。该证书是机制特定的,应用到 Tent 时仅接受 4.3% 更新且保留 0.6% 可用增益,说明安全信号不能跨自适应机制迁移。
  • - **对 BatchNorm 架构的独立性**:标准 BatchNorm-based TTA 在无 BatchNorm 的架构上会失效,而 CASTER 不依赖 BatchNorm 统计,通过判别子空间中的源类统计运输实现自适应。这使得它在 Transformer、ViT 等无 BatchNorm 骨干上依然可用,扩大了测试时自适应的适用范围,为冻结模型在多种现代架构上的部署提供了统一方案。

方法

输入与准备

CASTER 面向冻结模型部署:特征提取器与分类器均不更新,只用前向传播。部署前需要预先计算并存储源域类别统计量——每个类别的特征均值与协方差,并投影到低秩的判别子空间中,以去除噪声并保留类间可分性。运行时输入为目标批次样本及其在冻结模型上的特征。

关键模块与执行流程

  1. 判别子空间投影:使用源域特征学习一个线性子空间 W,将原始特征 z 映射为 Wz。该子空间强调类别判别方向,并显著降低后续统计量维度与存储。
  2. 目标批次矩估计:假设目标域与源域之间只存在类别共享的仿射偏移,即所有类别经历相同的线性变换 A 与平移 b。利用目标批次的特征矩(均值、协方差)与源域全局矩估计 A 和 b,无需标签或梯度。
  3. 仿射传输源分布:将存储的源类别均值与协方差进行 A 和 b 的变换,得到与目标批次对齐的类别分布。
  4. 分类:对目标样本,计算其投影特征与变换后各类别分布的距离(如马氏距离),选择最近类别作为预测。
  5. 可传输性证书与门控:计算残差到边际证书(residual-to-margin certificate),度量仿射假设不成立时残留误差与当前分类边际的比值。证书值超过阈值时,认为传输不可靠,门控关闭并回退到原始冻结特征的 k-NN 或基线分类。

与同类方法的差异

相比 Tent 等梯度型 TTA 需要更新 BatchNorm 参数、依赖反向传播,CASTER 完全无梯度、无优化器状态、不存储源特征库,仅额外保存低维类别统计量;同时其机制专属证书为不可靠传输提供显式安全开关,这是现有冻结模型适应方法普遍缺失的。

实验

实验设计

论文在 四个骨干网络 和 七个数据集(含 ImageNet-C)上评估 CASTER,所有设置均保持模型冻结,仅使用特征统计与在线批量矩估计。实验包含:

  • 冻结特征上对比 k-NN 分类器(27/28 设置中胜出);
  • 无条件仿射运输 vs 门控运输;
  • 307 个评估单元上分析证书阈值;
  • 将证书应用于 Tent 以验证机制特异性。

关键发现

  1. CASTER 在绝大部分 backbone-dataset 组合中优于 k-NN,且状态量中位数减少 18×。
  2. 无条件运输在 ImageNet-C(1000 类,batch=64)上损失 21.2 top-1,说明仿射变换并非总是可靠。
  3. 论文提出的 residual-to-margin 证书 能识别破坏性运输:所有损失超过 10 分的单元证书值均高于 3.9。
  4. 门控将无条件运输的平均 -3.35 点 效应转为 +1.69 点 增益,且性能在较宽阈值范围内与最佳阈值仅差 0.3 点。
  5. 证书机制不通用:应用于 Tent 时仅接受 4.3% 更新,保留 0.6% 可收益。

与基线对比的深度解读

  • CASTER vs k-NN:CASTER 不需要存储源特征库,仅保留类统计,状态开销更小;在几乎全部设置中精度更高,说明显式仿射运输比最近邻检索更适合批量分布偏移。
  • 门控 vs 无条件运输:门控通过证书筛选可信更新,将平均负效应转为正增益,表明单纯依赖统计矩对齐存在风险,而低成本安全信号能有效规避。
  • 机制特异性:同一证书在梯度法 Tent 上几乎失效,提示证书设计紧密耦合于运输假设,跨方法迁移需重估,不能直接复用。

行业影响

落地场景

CASTER 面向冻结模型 的测试时适应,适合无法反向传播的场景:

  • 推理专用加速器 / 边缘设备:内存与算力受限,不能更新参数
  • 第三方模型 API 或预训练模型:权重不可修改
  • 无 BatchNorm 的现代架构(如 ViT、ConvNeXt):传统 BatchNorm 统计适配失效
  • 实时在线推理:CASTER 无需反向传播,延迟极低

商业价值

  • 降本:相比 k-NN 基线,状态存储中位数减少 18×,无需保存优化器状态或源特征库,降低内存与硬件成本
  • 体验提升:在分布偏移下,gating 后的 CASTER 可将无条件传输的 -3.35 点损失扭转为 +1.69 点增益,直接提升预测准确率
  • 延长模型寿命:减少因数据漂移导致的重新训练或人工标注,提高 ROI

接口集成

  • 作为推理后处理模块:在特征提取器之后、分类头之前插入仿射传输层,无需修改原有权重
  • 封装为 standard ML serving 中间件:可与 TensorRT、ONNX Runtime 等框架集成,作为自定义算子
  • transportability certificate 作为安全门控:部署时监控证书值,低于阈值才应用传输,避免退化

具体 use case

  1. 电商推荐系统:推荐模型部署于推理芯片,遇到季节性商品特征漂移时,CASTER 对用户与商品特征做统计对齐,无需重新训练即可维持推荐相关性。
  2. 自动驾驶感知:车载边缘设备上,模型无法在线更新,面对天气/光照变化,CASTER 对中间层特征做仿射传输,提高检测鲁棒性;同时证书可防止极端分布下的错误传输。

局限

  • **传输假设与证书机制特定性**:论文在 Discussion 中明确承认,仿射传输假设所有类共享同样的偏移,这在分布偏移复杂或类别间偏移差异大时可能失效。传输性证书也是机制特定的,无法迁移到其他适应方法(如 Tent),这限制了其作为通用安全信号的适用性。实际部署中需要针对 CASTER 重新校准阈值。
  • **相对梯度 TTA 的性能差距**:当模型参数可更新时,梯度基 TTA 方法(如 Tent、EATA)仍高度具有竞争力,CASTER 的优势仅在模型必须冻结的场景。在 ImageNet-C 上,无条件传输甚至损失 21.2 top-1 点,依赖证书门控才能转为正增益,说明方法本身对分布偏移的类型和批量大小敏感,可靠性不足。
  • **对源类统计和批量估计的依赖**:CASTER 需要在训练阶段(或离线)存储源类别的统计量,并且推理时要估计目标批次的一阶、二阶矩,这些估计在批量较小或类别数很多时可能不稳定。此外,论文未讨论如何获取源类统计(是否允许访问源数据),这在实际第三方模型或隐私受限场景可能成为障碍。
论文Salim Khazem2026-08-31原文

相关内容