论文

面向不可逆火灾损伤后物体理解的特征恢复

面向不可逆火灾损伤后物体理解的特征恢复

火灾后的物体往往经历不可逆的物理形变,其几何结构、材质状态与视觉外观均被改变。检测并识别这些残留物,对定位危险源、重建事故前内容、清点损失至关重要。与常见的图像退化不同,这类损伤直接改变了物体自身的物理结构。为此,作者提出 TRACE,一个面向火灾后物体理解的变换感知基准,包含 21.4K 个基于真实图像的合成场景,以及覆盖 189 个类别、499 个物体身份的「完好—退化」配对渐进序列。 TRACE 定义了五项聚焦定位与退化前理解的任务: 1. 退化物体检测 2. 完好状态恢复与检索 3. 原始材质恢复 4. 完好描述生成 5. 功能推理 现有模型随损伤加剧性能骤降:从最轻到最重等级,RF-DETR 的 mAP 相对下降 71%,InternVL3.5 的检索 R@1 从 93.85 跌至 28.11。为此,作者提出特征恢复模块(Feature Recovery Module, FRM),一个即插即用模块,在冻结宿主模型的前提下将退化编码器特征映射为与完好状态对齐的表征,仅用配对特征监督训练。 FRM 在场景级检测、CLIP/SigLIP2 特征恢复以及全部四项物体级 VLM 任务上均带来提升,且退化越严重增益越大。跨不同 VLM 宿主与严重程度,相对增益平均为:检索 12.5%、材质恢复 20.1%、描述生成 13.2%、功能推理 12.4%。

论文精读

TL;DR 提出 TRACE 灾后对象理解基准,揭示现有模型在不可逆烧损下性能骤降;FRM 即插即用特征恢复模块在严重退化下将检索、材质恢复等任务平均提升 12-20%,且保持主模型冻结。

问题

问题背景

灾后环境感知正成为计算机视觉的实用化方向,尤其是火灾现场 中受损物体的定位与属性恢复,直接关系到安全排查、损失评估与灾后重建。

现有方法局限

主流模型通常假定图像退化是可逆的传感器噪声 或表面污损(如雨、雾、模糊),通过去噪或增强即可恢复。但火灾造成的是物理结构不可逆变形:物体几何形状、材质状态、视觉外观均发生根本改变,且不存在对应的“干净”参考帧。在 TRACE 基准上,从最轻微到最严重退化等级,RF-DETR 的 mAP 相对下降 71%;InternVL3.5 的检索 R@1 从 93.85 骤降至 28.11,显示通用模型对这类分布外退化的脆弱性。

为什么这个问题难且重要

难点在于:退化程度与物体类别强相关,同一物体在不同火损阶段特征漂移巨大;且真实成对训练样本难以采集,必须依赖合成数据引导。同时,任务横跨检测、跨模态检索、描述生成与功能推理,要求模型不仅“看见”受损物体,还要“理解”其原始状态。工程上,灾后机器人巡检、保险定损、消防安全审计等场景迫切需要可部署的鲁棒模型,而现有视觉-语言模型在严重退化下几乎失效。

行业类比

类似自动驾驶在极端天气下的感知退化:传感器输入被严重破坏时,单纯增加数据增强无法弥补物理域偏移,需要显式的特征恢复或域对齐模块来保持下游任务性能。

核心洞察

  • **特征空间可逆恢复** 是本次工作的核心视角:火灾造成的不可逆物理退化被建模为深度特征空间的失真,而非像素域损坏。同类工作通常将灾后图像视为图像复原或域偏移问题,需要重建原图或微调下游模型;而 FRM 只训练一个轻量映射模块,冻结主机 VLM / 检测器,在配对特征监督下将退化编码特征拉回 pristine-aligned 表征。该差异让部署成本极低,且验证了物理结构变化可以在语义特征层被部分补偿,无需还原像素。
  • **严重度导致的性能崩塌曲线** 揭示了现有模型的极端脆弱性:RF-DETR 在低到高严重度下 mAP 相对下降 71%,InternVL3.5 retrieval R@1 从 93.85 跌至 28.11。独特之处在于基准同时提供逐级退化进度,使研究者能定位模型在哪个阶段开始失效;而 FRM 的收益随严重度上升而增大,说明轻量特征对齐模块在极端物理形变下比重新训练或数据增强更高效,为应急响应等资源受限场景提供了实用方向。

方法

输入:给定包含火灾退化物体的图像,使用冻结的视觉编码器提取特征。这些编码器可以是检测器骨干(如 RF-DETR、CLIP、SigLIP2)或 VLM 图像塔。退化特征丢失了原始物体的几何、材质与语义线索。

关键模块:FRM (Feature Recovery Module) 是轻量即插即用模块,插在编码器输出与下游任务头之间。它通过可训练映射将退化特征投影到与 pristine 状态对齐的特征空间。训练时冻结宿主模型全部参数,仅优化 FRM;监督信号来自成对的 pristine-degraded 特征,使恢复后特征接近原始未退化特征。这种特征级监督避免了对图像像素的直接恢复,只需恢复对下游任务重要的判别信息。

输出:恢复后的特征可直接供下游使用,无需微调宿主:

  • 场景级检测:替换或增强检测器输入特征,提升退化目标 mAP;
  • 检索与 VLM 任务:恢复的特征用于 CLIP/SigLIP2 检索、材料恢复、描述生成、功能推理。实验显示在更严重退化下增益更大。

与同类方法差异:传统 degradation-robust 方法通常在像素空间做图像修复或增强,但火灾造成的物理破坏不可逆,像素级真实值不存在;FRM 在特征空间恢复语义身份,绕开了像素重建的不适定问题。

实验

实验设计

TRACE 基准包含 21.4K 张合成场景图,覆盖 189 个类别、499 个对象身份,并按退化严重程度分级。定义五项任务:退化目标检测、原始状态恢复与检索、原始材料恢复、原始描述生成和功能推理。基线模型包括 RF-DETR(检测)和 InternVL3.5(VLM 检索与生成)。提出的 FRM 即插即用,冻结宿主编码器,仅用配对特征监督训练。

关键发现

随着退化严重度增加,模型性能急剧下降:RF-DETR 的 mAP 相对下降 71%;InternVL3.5 的 retrieval R@1 从 93.85 跌至 28.11。引入 FRM 后,在场景级检测、CLIP/SigLIP2 特征恢复以及四个对象级 VLM 任务上均有提升,且退化越严重增益越大。平均相对增益:检索 12.5%、材料恢复 20.1%、描述生成 13.2%、功能推理 12.4%。

与基线对比解读

FRM 的优势在于不修改宿主模型,仅通过特征映射恢复原始表征,因此可迁移到不同 VLM 骨干。相比直接微调或图像增强,FRM 用配对特征监督,避免需要成对图像数据,训练成本低。在严重退化场景,由于物理结构改变不可逆,标准图像修复难以恢复,而 FRM 在特征空间对齐原始分布,能有效提升下游理解。

行业影响

落地场景

  • 保险理赔与定损:火灾后,保险公司需快速清点损毁物品并估算原值。TRACE 的退化物体检测、材料恢复与描述生成能力可自动化识别烧毁物品,减少人工现场勘查。
  • 自动驾驶与救援机器人:无人机或地面机器人在火灾废墟中作业时,可利用 FRM 恢复退化图像特征,提升对烧损障碍物、危险品的感知鲁棒性,辅助导航与搜救。

商业价值

  • 降本:自动定损可将理赔处理周期从数天压缩至数小时,降低人力成本与误判率。
  • 体验与增收:保险客户获得更快赔付,满意度提升;同时欺诈性高估减少,控制赔付支出。
  • 公共安全:快速识别危险物(如锂电池、化学品)可降低二次伤害风险。

与现有工作流的集成

FRM 为 plug-and-play 模块,可插入 CLIP/SigLIP2 等视觉编码器或 VLM 前端,无需重训宿主模型。部署方式:

  1. 导出为 ONNX/TensorRT,作为图像预处理或特征增强微服务集成到保险定损平台或机器人感知栈。
  2. 典型链路:图像采集 → FRM 特征恢复 → 检测/VLM 推理 → 业务逻辑(理赔审核、路径规划)。

这一低耦合设计允许在不改变现有模型权重的前提下提升退化场景性能,适合快速迭代的工业部署。

局限

  • **数据集合成性带来的偏差**:TRACE 基于真实图像合成退化场景,虽然能保持对象身份的一致性,但合成退化过程(如火焰损伤、碳化纹理)可能与真实火灾后的物理变化存在差异。真实场景中的烟雾、多阶段燃烧、材质熔融等复杂现象难以完全模拟,因此模型在合成数据上的性能提升能否直接迁移到真实灾后图像仍需进一步验证。该 gap 可能限制 FRM 在实际部署中的可靠性。
  • **FRM 依赖成对监督的扩展性局限**:FRM 训练时需要 pristine 和 degraded 对象的成对特征,这在真实场景中很难获取。对于未知对象或未出现在训练集中的类别,如何构造或估计 pristine 特征尚不明确。若无法获得可靠的 pristine 参考,FRM 的映射可能失效,这限制了其在开放世界灾后识别中的应用范围。
  • **高层语义任务的主观性与评估局限**:原始材料恢复、描述生成和功能推理等任务依赖人工标注,可能存在主观性。评估指标(如 R@1、文本匹配度)是否能全面反映实际灾后内容还原的需求还不确定。例如,功能推理的正确性可能需要结合领域知识,单纯依赖 VLM 的生成结果可能无法满足应急救援和损失评估等实际场景的严格要求。
论文Aditi Tiwari2026-09-10原文

相关内容