论文

AffectFlow-DINO: 通过条件整流流实现不确定性感知的多任务情感估计

AffectFlow-DINO: 通过条件整流流实现不确定性感知的多任务情感估计

我们提出 AffectFlow-DINO,一个用于第11届 ABAW 挑战赛的多任务学习系统。该系统通过条件整流流头部扩展标准确定性架构,以建模野外面部行为的固有模糊性。模型不预测单一情感估计,而是学习一个条件生成分布,通过蒙特卡洛采样实现不确定性感知的一对多预测。 系统从静态人脸图像中联合估计连续效价-唤醒度、分类八种面部表情并检测十二个动作单元。基于冻结的 DINOv3 ViT-S/16 骨干网络,消融研究表明整流流解码持续改进确定性预测,尤其使效价-唤醒度估计的 CCC-V 提升 +0.058。 进一步,事后阈值校准有效恢复了严重不平衡稀有类别的性能(如 Fear:3.8% 提升至 33.1%),无需重新训练。结合骨干微调和流重调,最终模型达到 P{MTL}=1.177,显著优于官方基线 P{MTL}=0.45。

论文精读

TL;DR AffectFlow-DINO 在冻结 DINOv3 骨干上引入条件 Rectified Flow 头,将确定性情感估计拓展为不确定性感知的生成式分布,显著提升 valence-arousal 预测与稀有表情分类,多任务得分远超 ABAW 基线。

问题

问题背景

基于面部图像的多任务情感感知(连续效价-唤醒度估计、表情分类、动作单元检测)是情感计算与自然人机交互的核心问题,尤其严苛的野外场景(in-the-wild)下模型需要从静态图像中提取鲁棒的、可解释的情感线索。

现有方法局限

当前主流方案多采用确定性架构,直接输出单一预测值,这忽略了一个根本局限:面部情感本身具有高度的模糊性与多义性,同一种表情在不同上下文或个体间可能对应不同的情感状态,确定性模型无法合理表达这种不确定度,导致“过度自信”的错误预测。此外,多任务学习(MTL)中通常按固定权重联合优化,对极不平衡的稀有类别(如恐惧表情仅占 3.8%)缺乏针对性校准,容易倾向于大类而牺牲长尾性能。近年虽有基于 GAN 或扩散模型的生成式尝试,但训练不稳定或推理效率低下,难以同时保留多任务输出与不确定性量化。

为什么该问题既难又重要

  • 技术挑战in-the-wild 图像存在光照、遮挡、姿态与个体差异,情感标注本身高度噪声,要求模型既能拟合复杂分布,又能量化预测可靠性。同时多任务联合优化易引发梯度冲突,稀有类别的不平衡加剧了训练难度。
  • 业界关注:情感感知能力直接影响人机交互(如虚拟助手、心理监测)、驾驶员监控(疲劳分心检测)、内容推荐(用户情感反馈)等场景的落地效果,更精准且具备不确定性估计的系统是商业应用的安全壁垒。

行业类比

这类似于自动驾驶感知中从单帧确定性检测转向概率性目标检测——不仅要知道障碍物在哪里,更要告诉下游规划模块“这个检测有多不可靠”,以便系统做出安全决策。

核心洞察

  • **条件整流流将点估计变为生成分布**:模型在冻结 DINOv3 骨干上附加 Conditional Rectified Flow 头,学习情感标注的生成分布而非单点预测。通过蒙特卡洛采样输出多个合理估计,量化了自然场景面部行为的模糊性,使不确定性估计内建到预测中。相比标准确定性多任务学习,这直接带来了 Valence-Arousal 估计指标 CCC-V 提升 0.058,也为下游决策提供了置信度参考。
  • **后验阈值校准解决极端类不平衡**:针对稀有表情(如 Fear)几乎被模型忽略的问题,作者仅对输出 logit 调整分类阈值,无需重新训练,就将 Fear 召回率从 3.8% 提升到 33.1%。这种轻量后处理策略在工程中易于实施,为部署后的类别分布漂移提供了快速补救方案,启示我们在流程末端设计可调阈值比改动训练损失更经济。
  • **冻结预训练骨干+可调 Flow 头的解耦范式**:系统固定 DINOv3 ViT-S/16 避免大模型微调成本与过拟合,仅训练轻量级 Rectified Flow 解码器及任务头,后续通过低学习率微调骨干和 Flow 重训练两步适配领域。这种“通用视觉编码器 + 任务特定生成头”的架构既保维持了预训练表示的鲁棒性,又灵活捕获了情感标注的多模态分布,适合资源受限的多任务情感计算落地。

方法

输入与主干模型

输入为静态人脸图像,通过DINOv3 ViT-S/16 骨干网络提取语义特征。默认骨干冻结,后续实验可微调以进一步提升性能。

多任务输出头

骨干输出特征共享给三个任务头,分别处理:

  • 效价-唤醒度(Valence-Arousal, VA)回归:预测连续效价和唤醒度值,评估采用一致性相关系数(CCC)。
  • 表情分类:8类基本表情(含“中性”)的分类。
  • 动作单元检测:12种动作单元的二分类(有无)。

每个任务头的基础结构为轻量线性层,但核心创新在于引入条件整流流(Conditional Rectified Flow)解码器,替代传统的确定性输出。

条件整流流解码与不确定性估计

对于每个任务(尤其VA回归),模型不直接输出一个点估计,而是学习一个条件生成分布

  • 给定骨干特征,条件整流流模型将简单先验分布(如标准高斯)通过学习到的速度场逐步变换为复杂的目标分布(对应情感标注的可能输出)。
  • 训练时,最小化流损失(如匹配噪声到目标的条件矢量场)与任务原始损失(CCC、交叉熵等)的组合。
  • 推理时,通过蒙特卡洛采样:从先验采样多个噪声向量,经数值ODE求解器(如Euler法)模拟反演过程,得到多个预测样本。最终,取样本均值作为确定性输出,同时样本方差可反映认知不确定性

这种方式将标注歧义和噪声天然建模,提升了预测鲁棒性,尤其对VA估计的CCC提升达+0.058。

后处理阈值校准

对于严重不平衡的表情分类和AU检测,利用验证集对每个类别/单元独立搜索最优决策阈值,而不改动模型参数。例如,恐惧(Fear)分类召回率从3.8%跃升至33.1%。校准后可直接提升宏平均F1等指标。

训练流程

整体采用多任务联合训练,损失函数为:

  • VA任务:负CCC + 流损失
  • 表情任务:类加权交叉熵 + 流损失
  • AU任务:二值交叉熵(可加正样本加权) + 流损失

各损失项加权求和,权重由消融实验确定。实验还包括骨干微调与“流重调”(flow retuning)等优化策略。

与其他方法的差异:相比传统多任务情感识别仅输出点估计,AffectFlow-DINO通过整流流赋予模型显式的不确定性建模能力,在保持预测精度的同时量化输出置信度,且无需对每个任务设计复杂概率先验。

实验

实验设计:基于第11届ABAW挑战的Aff-Wild2数据集,模型联合估计连续效价-唤醒度(VA)、分类8种基本表情、检测12个动作单元(AU)。骨干为冻结的DINOv3 ViT-S/16,多任务头包括确定性回归/分类头和条件整流流头,后者通过蒙特卡洛采样生成分布预测。训练采用掩码监督,对缺失标注任务不传播损失。

关键发现:整流流解码一致地提升了确定性预测,VA估计的CCC-V提高+0.058。通过后验阈值校准,恐惧表情识别率从3.8%跃升至33.1%,无需重新训练。最终模型多任务性能指标P_MTL达到1.177,远超挑战基线0.45。微调骨干和流重调进一步带来增益。

与基线对比深度解读:标准多任务基线通常输出单一点估计,无法量化预测不确定性。整流流头将预测建模为条件分布,利用生成先验改善点估计质量,尤其对连续维度模糊性大的VA任务效果显著。阈值校准作为一种轻量级后处理,有效应对了野外数据的长尾类不平衡,其成功表明在资源受限场景中,无需重新训练模型即可挖掘分类头潜力。整体多任务学习框架证明,冻结大模型特征加任务特定流式解码器是一种极具竞争力的范式。

行业影响

落地场景

AffectFlow-DINO 提供了一个轻量、不确定性感知的面部情感多任务估计方案,可直接嵌入需要实时理解用户情绪的产品中。典型场景包括:

  • 视频会议与远程协作:实时估计参会者的 valence-arousal 和表情,辅助会议摘要、参与度分析或自动生成情绪标签。
  • 内容与娱乐平台:在短视频或直播中,根据观众的微表情和动作单元(AU)动态调整推荐流或交互特效。
  • 车载与智能座舱:通过驾驶员表情和 AU 检测疲劳、分心,结合不确定性量化过滤低置信度预警。
  • 健康与辅助技术:在心理健康筛查或自闭症干预中,持续追踪表情和情绪趋势,提供客观量化指标。

商业价值

  • 降本:利用冻结的 DINOv3 ViT-S/16 骨架 + 轻量头部,无需大量标注数据即可获得有竞争力的多任务表现,显著降低数据采集和训练成本。模型支持后处理校准(如阈值优化)直接提升长尾类别性能,避免昂贵的重训练。
  • 增收:在广告和推荐中,细粒度的情感反馈可提升内容匹配度和用户粘性,直接拉动广告eCPM和订阅转化。不确定性建模提供置信度输出,用于高风险场景的决策过滤,减少误触发带来的负面体验。
  • 体验提升Conditional Rectified Flow 头提供多模态预测分布,使系统能够给出更自然、鲁棒的情绪标签,而非单一硬判决,增强交互亲和力。

与现有产品/工作流的接口

AffectFlow-DINO 设计为即插即用的视觉推理模块:

  • 易于集成:骨干固定,仅需训练轻量头部,兼容主流推理框架(PyTorch / ONNX)。可直接插入现有视频处理管线,逐帧输出 VAexpressionAU 结果。
  • 不确定性消歧:输出包含 Monte Carlo 采样的分布信息,下游系统可据此设置阈值或触发人工复核。例如,在客服情绪分析中,仅对高置信度的负面情绪进行告警。
  • 后处理校准:提供的 per-class threshold calibration 方法可离线计算最优阈值,无需改动模型训练流程,方便与业务规则引擎结合,快速适配不同应用场景的类别不平衡需求。

具体 Use Case

  • 在线教育平台交互优化:在学生端实时分析表情和 AU,当检测到困惑(皱眉 AU4 + 低 valence)并满足置信度门限时,自动推送提示或调整讲解节奏,提升完课率。该能力可封装为 SDK 集成到现有 LMS 中,不依赖云端大模型,保障延迟和隐私。
  • 直播电商情绪反馈:主播端分析观众群体的表情分布和 VA 均值,将情绪趋势通过仪表盘反馈给主播,辅助商品讲解策略调整。利用 AffectFlow-DINO 的多任务输出,可同时捕捉到“惊讶”表情和“高 arousal”,实时标识爆点,指导商品上架节奏。模型输出可与现有推荐系统联动,对高 arousal 时段自动投放限时优惠,提升转化。

局限

  • **模型仅处理静态图像**,未利用视频序列中的时序动态信息。情感行为本质上具有时间连续性,单帧预测缺乏上下文,可能导致在动态表情(如微笑的起始与消退)或微表情上表现不稳定。尽管通过 Monte Carlo 采样可以获得预测分布,但实际部署时实时性受限,需要多次前向传播,不适合低延迟场景。
  • **多任务平衡依赖手动调参**,损失函数中的任务权重(如 VA、EXPR、AU 的损失系数)通过消融实验确定,并未引入自动权重学习机制(如不确定性加权)。在数据集分布或任务重要性变化时,需要重新调整,泛化性受限。此外,后处理阈值校准完全基于验证集统计,无法适应测试时的分布偏移,可能在实际应用中出现性能退化。
  • **条件整流流头虽提升了确定性预测,但生成能力尚未充分挖掘**。论文主要利用采样的平均值作为改进的确定性估计,并未深入探索生成多样性在情感识别中的价值(如生成多个 plausible 的 VA 坐标用于交互式系统)。同时,对罕见类别的恢复主要依赖简单阈值校准,而非从特征表示层面解决长尾问题,导致模型对稀有 AU 或表情的区分能力依然较弱。
论文Salah Eddine Bekhouche2026-07-14原文

相关内容