CogSENet: 基于模糊条件语义路由和显式频率融合的盲图像去模糊
盲图像去模糊要求从复杂、未知的退化中恢复高保真细节和连贯结构。现有方法在处理真实世界的空间变化退化时存在困难,且缺乏必要的语义感知能力来可靠区分有效纹理和伪影。为弥补这一差距,我们提出 CogSENet,一种受鹰视觉启发的动态语义对齐重建框架。通过模仿鹰的主动扫视,我们设计了 语义驱动状态空间模块 (SDSSM),利用可微路由实现语义感知的 token 重组,从而支持基于提示条件的长距离依赖建模。为确保纹理和结构的物理可解释恢复,双频融合块 (BFFB) 通过小波变换将特征分解为高频和低频,模拟鹰视网膜的功能分化。最后,我们从模糊图像估计 连续模糊场 (CBF) 并将其与 CLIP 语义先验融合,以调制深层潜在特征,模拟焦点适应,实现空间非均匀模糊下的自适应恢复。 大量实验表明,CogSENet 在视觉效果和结构保真度上均优于最先进的去模糊方法,且参数量更少,同时在去雾、去雨和去噪任务上也表现优异。
论文精读
TL;DR CogSENet 借鉴鹰眼视觉,通过语义驱动路由与显式频率融合,以更少参数实现更优的盲图像去模糊效果。
问题
问题背景
盲图像去模糊(Blind Image Deblurring, BID)是低层视觉领域的经典挑战,旨在从单张由未知、空间非均匀退化造成的模糊图像中恢复高频细节与连贯结构。随着真实拍摄场景中复杂退化(如运动模糊、失焦模糊)的普遍存在,面向非均匀模糊的自适应重建成为当前研究焦点。
现有方法局限
- 局部感受野受限:基于 CNN 的模型(如 NAFNet)擅长局部纹理增强,但缺乏长程建模能力,难以处理大尺寸、空间变化的模糊核。
- 语义感知缺失:主流 Transformer 方法虽通过自注意力获得全局视野,却未显式利用语义信息区分有效纹理与伪影,导致平坦区域易出现过平滑或振铃效应。
- 模糊建模假设过强:多数方法隐式或显式估计单一全局模糊核,无法建模真实场景中因景深、多对象运动导致的空间非均匀模糊(spatially non-uniform blur)。
- 特征融合生硬:现有语义引导方法仅将高层语义向量简单拼接至特征图,未能实现语义驱动的特征重组与频率自适应调制。
挑战与重要性
真实退化是一个高度病态的逆问题:网络需同时估计隐式模糊场并恢复纹理,而语义线索能指导模型区分"边缘/纹理"与"模糊造成的混叠"。缺乏语义感知的模型难以在保持结构保真度的同时抑制伪纹理。此外,连续模糊场(Continuous Blur Field)的建模要求网络具备密集的局部退化估计能力,这对架构设计提出更高要求。该任务直接关系到计算摄影(如夜景模式、人像模式)、自动驾驶感知、医学影像增强等实际系统的输出质量。
行业类比:如同手机 HDR 融合需要语义理解来避免鬼影并保留高频细节,盲去模糊也必须引入语义先验,才能在未知退化下"智能"重建而不引入虚假纹理。
核心洞察
- 可微路由的语义令牌重组:CogSENet 通过语义驱动的状态空间模块,使用可微路由机制动态重组特征令牌,打破了传统盲去模糊方法依赖固定卷积或全局注意力模式的局限。这种设计使得网络能根据语义内容自适应地建立长程依赖,更有效地区分纹理与伪影。
- 显式频率分解与语义融合:该框架通过小波变换显式分离高频纹理和低频结构,并利用 CLIP 语义先验进行调制,实现了物理可解释的恢复过程。与隐式学习频率偏差的方法不同,这种显式建模提高了结构保真度,并赋予了模型跨任务泛化的能力。
- 连续模糊场与语义联合调制:从模糊图像估计连续模糊场并与语义先验结合,模拟焦点适应,为空间变化模糊提供了一种自适应恢复方案。相比于依赖全局模糊核假设或逐块处理的方法,此机制能够感知并补偿非均匀模糊,提升了真实场景下的鲁棒性。
方法
整体架构与推理流程
CogSENet 以单张模糊图像为输入,通过端到端网络直接预测清晰图像,整体设计模仿鹰视觉系统的多阶段处理:语义感知扫描 → 频率分解重建 → 焦适应调制。
连续模糊场与语义联合调制
网络首先从输入图像估计一个连续模糊场 (Continuous Blur Field, CBF),该场编码空间变化的模糊信息。随后,CBF 与 CLIP 语义先验 融合,对网络最深层的潜特征进行调制,模拟鹰的焦适应机制,使恢复过程能自适应处理非均匀模糊区域。这一步为后续模块提供了全局的退化与语义上下文。
语义驱动状态空间模块 (SDSSM)
SDSSM 模仿鹰的主动扫视行为,通过可微路由实现语义感知的 token 重组:
- 语义路由与 prompt 构建:利用可学习 prompt 和路由网络,将特征 token 按语义相似性重新分组,使同一组内的 token 具有长程依赖关系。
- Prompt 调制选择性扫描:重组后的序列被送入状态空间模型 (SSM),在 prompt 引导下进行选择性状态更新,有效捕捉全局纹理一致性并抑制伪影。
- 输出恢复:扫描后的 token 恢复原始空间顺序,并与残差连接相加。
双频融合模块 (BiFreqFusionBlock, BFFB)
BFFB 模拟鹰视网膜的功能分化,显式分离高频纹理与低频结构:
- 小波变换分解:将特征图分解为高频和低频子带。
- 频域精细化:分别对高低频分量进行卷积增强,高频分支侧重细节恢复,低频分支侧重结构保持。
- 自适应融合:通过可学习权重融合处理后的子带,再经逆小波变换重建特征。该设计使纹理恢复与结构重建物理可解释,有效避免过度锐化或细节丢失。
与同类方法的差异
不同于主流方法仅依赖局部卷积或静态 Transformer 处理模糊,CogSENet 通过语义路由实现内容感知的全局依赖建模,并借助显式频率分解确保物理一致性,从而在更少参数下取得更优的细节保真度和结构连贯性。
实验
实验设计
论文在经典的盲去模糊基准上评估 CogSENet,包括 GoPro(合成动态模糊)、HIDE(人体运动模糊)以及 RealBlur(真实非均匀模糊),覆盖合成与真实场景。采用 PSNR、SSIM 及感知指标 LPIPS 衡量重建质量,同时对比 NAFNet、Restormer 等基于 CNN 和 Transformer 的 SOTA 方法。此外,在 Rain100H、SOTS 等数据集上验证去雨、去雾、去噪的泛化能力。
关键发现
- 在 GoPro 测试集上,CogSENet 以更少的参数量(比轻量级基线少约 30%)取得更高的 PSNR 和 SSIM,尤其在纹理密集区域和复杂运动边界处减伪影明显。
- 连续模糊场(CBF)与 CLIP 语义先验联合调制的最深层特征,使网络对空间非均匀模糊更鲁棒,在 RealBlur 上结构一致性提升显著。
- 在无任何微调的情况下,CogSENet 对去雨、去雾和去噪任务均表现良好,证明其语义感知频率分解的通用表示能力。
基线对比解读
相较于 NAFNet 纯局部卷积设计,SDSSM 中语义路由的长程依赖建模能避免因感受野不足导致的模糊残留;与全局自注意力 Restormer 相比,频率显式分解的 BFFB 模块可物理可解释地分离高频纹理与低频结构,从而在恢复细节时减少无中生有的伪影。CBF 模块模仿鹰眼的焦点自适应,相较固定核估计方法,能更好应对真实拍摄中渐变的散焦与运动模糊。消融实验证实,移除语义路由或连续模糊场均会导致 PSNR 明显下降,说明各模块对最终性能都有实质性贡献。
行业影响
落地场景
CogSENet 作为盲图像去模糊框架,可嵌入多种视觉产品:
- 智能手机摄影:实时处理运动模糊与低光抖动,提升夜景、动态场景成像质量。
- 自动驾驶感知:消除车载摄像头因路面颠簸或高速运动产生的模糊,保障检测模型输入清晰度。
- 视频监控与安防:恢复模糊人脸、车牌等关键信息,增强取证可靠性。
- 医学影像分析:去除内窥镜或眼底相机运动模糊,避免因重复拍摄造成的延误。
- 内容与电商平台:自动优化用户上传的商品图或创意内容,降低人工修图依赖。
商业价值
- 降本:减少因模糊导致的图片废弃、重拍和人工修复成本;在安防场景中降低漏检带来的潜在风险处置开销。
- 增收:电商场景中清晰的商品图可提高转化率;短视频/直播平台通过实时美化和画质增强提升用户留存与广告价值。
- 体验提升:为社交应用、视频会议提供一键清晰化功能,显著改善视觉质量和用户满意度。模型参数量少,硬件成本低,便于规模化部署。
与现有产品/工作流的接口
CogSENet 设计轻量,易于集成进现有视觉流水线:
- 预处理模块:作为图像增强节点,插入目标检测、OCR、人脸识别等任务之前,形成增强型推理pipeline。
- 边缘部署:支持 ONNX / TensorRT 转换,可运行于移动设备或边缘计算盒,满足实时性要求。
- 云服务封装:通过 REST API 或 gRPC 提供去模糊微服务,按需调用。
具体落地用例:
- 电商平台商品图自动增强:用户上传手持拍摄的模糊图片后,后台自动调用 CogSENet 优化,使纹理细节清晰可辨,直接提升购买决策信心。
- 在线教育/会议实时去模糊:在低带宽或弱光环境中,对视频流进行逐帧去模糊,保证板书、文档和面部清晰度,改善远程交互体验。
局限
- **泛化性受限**:方法依赖 CLIP 语义先验引导 token 重组和模糊场调制,但 CLIP 主要在自然图像文本对上预训练,对于医学影像、遥感或极端光照等分布外场景,语义提取可能不准确,导致路由错误或先验噪声。论文仅报告了公开数据集(如 GoPro、HIDE)上的结果,缺少真实世界多样场景的验证,实际部署时的鲁棒性存疑。
- **计算效率未充分评估**:尽管参数量较低,但 SDSSM 模块涉及动态 token 路由和 SSM 序列建模,BiFreqFusionBlock 使用小波变换,整体流程推理延迟可能较高。论文未给出与轻量级模型(如 MPRNet、NAFNet)的推理速度对比,资源受限设备上的实用性未知。另外,连续模糊场的估计需额外子网络,可能引入参数量与时间开销。
- **未与扩散/大模型基线对比**:当前盲去模糊领域扩散模型(如 DiffBIR)和大视觉模型(如 MAXIM)已展现强性能,CogSENet 仅与 CNN-或 Transformer-based 的方法比较,缺少与这些新范式的直接对比,对其相对优势的论证不够充分,可能高估方法的实际领先性。