从二维网格到一维Token:改革多模态图像融合的共享表示
多模态图像融合旨在整合不同模态的互补信息,生成既保留丰富局部细节又保持全局一致外观的融合图像。现有方法在2D特征网格上构建共享表示,擅长建模局部结构,但对图像级全局外观因素的控制有限。 为平衡局部与全局目标,我们引入基于冻结预训练图像分词器的紧凑一维Token接口,用于建模非局部外观因素。该设计不将分词器用作重建主干,而是将一维Token空间作为全局载体,同时保留2D空间路径用于局部结构恢复。具体地,我们提出选择性Token编辑(STE),稀疏更新/替换一小部分关键Token,轻量地引导全局外观一致性,保持融合主干不变且无需额外损失。 在四个常用基准(如RoadScene、MSRS等)上的实验表明,我们的方法在全局一致性和局部保真度上均取得一致的多指标改进,实现最佳整体性能。
论文精读
TL;DR **1D token 接口** + **选择性token编辑**,用冻结的预训练图像分词器将2D特征转化为1D token 作为全局载体,稀疏更新关键 token 以调控全局外观,同时保留2D路径恢复局部细节,实现多模态融合中全局一致性与局部保真度的最优平衡。
问题
问题背景
多模态图像融合旨在整合不同传感器(如红外与可见光、医学影像)的互补信息,生成兼具局部细节 和全局外观一致性 的融合图像,广泛用于安防监控、医学诊断、计算摄影等场景。
现有方法的局限
当前主流方法基于 2D 特征网格 (2D feature grids) 构建共享表示,通过 CNN 或 Transformer 在空间维度上建模。尽管擅长捕获局部结构,它们对 图像级全局外观因素(如光照、色调、对比度分布)的控制力不足,具体表现为:
- 局部偏向性 (Locality-Biased):2D 特征图的每个位置仅感知邻域,难以显式编码全局统计量,导致外观因素被冗余广播到所有位置,控制分散。
- 基础建模不稳定 (Unstable Base Modeling):2D 空间中的全局外观易受局部纹理干扰,难以解耦和独立调整。 结果常出现色彩偏移、亮度不协调等全局不一致问题。
技术挑战与重要性
平衡局部细节保真 与全局外观一致性 是核心难点。直接强化 2D 网络的全局建模(如增加自注意力)会带来高计算开销,并可能损害空间细节。业界需要一种既能 保留 2D 空间通路 以维持局部结构,又能 以紧凑方式操控全局外观 的表示。论文引入的 1D token 接口 利用预训练图像 tokenizer 的离散潜码空间作为全局载体,而 选择性 Token 编辑 (STE) 仅需修改极少数关键 token,即可轻量高效地引导外观,无需改变融合骨干网络,体现了解耦与低成本的工程优势。
行业类比
这类似于 大型语言模型的激活操控:通过编辑少量关键 token 或表示来定向调整模型行为,而无须重新训练;或在图像生成中,通过修改 StyleGAN 的少量风格码改变整体图像风格,为工业部署提供了高效的全局控制手段。
核心洞察
- - **1D token界面** 解耦局部与全局建模:现有融合方法在2D特征网格上操作,隐式混合局部结构和全局外观,导致亮度、对比度等图像级属性难以精确控制。本文通过冻结的预训练图像tokenizer,将全局外观压缩为少量1D tokens,与处理局部细节的2D路径分离,从而实现对非局部因素的显式且稳定建模。这与直接将tokenizer作为重建骨干不同,而是将其作为“外观控制器”,避免了2D网格中基础因子广播引起的噪声放大。
- - **选择性token编辑(STE)** 实现轻量即插即用全局控制:STE仅更新/替换预训练token序列中0.8%的关键token,无需改变现有融合主干网络或引入额外监督,即可显著提升全局一致性。该设计将token空间视为紧凑控制界面,使得任意2D融合模型只需增加token接口即可受益,实验证明在多种度量下均有一致提升,展示了该机制的可迁移性和高效性。
方法
输入与表示
多模态图像融合的输入通常为一对或多张已配准的源图像(如可见光与红外)。传统方法将所有模态的局部细节与全局外观建模统一在 2D 特征网格 上,其卷积归纳偏置天然倾向于捕捉高频局部结构,但对亮度、对比度等图像级全局基因素(base factors)的表达能力受限。
从 2D Grids 到 1D Tokens
本文重新设计共享表示:保留原有的 2D 空间路径 负责局部结构恢复,同时引入一条并行的 1D token 路径 来显式建模非局部外观基因素。具体做法是采用一个 冻结的预训练图像分词器(tokenizer)(如 VQGAN),将源图像编码为一组紧凑的 1D tokens;这些 tokens 不直接用于重建,而是作为全局外观的“载体”。
Token-to-Map 接口
为了实现 1D tokens 与 2D 融合主干的交互,设计了一个 Token-to-Map 接口。该接口通过交叉注意力将 1D token 中的全局信息注入到 2D 特征图中,使局部细节的恢复过程能感知图像级基因素的引导。该模块轻量且即插即用,可接入现有的 2D 融合骨干。
选择性 Token 编辑(STE)
核心创新是 选择性 Token 编辑(Selective Token Editing, STE):一个轻量级的选择器从 token 序列中 稀疏地选取并更新/替换少量关键 tokens,而无需通过分词器完整重建图像。这种机制以极小计算开销实现了对全局外观一致性的精细控制,同时保持融合骨干不变、避免引入额外损失项。
训练与输出
训练时仅优化新增的轻量模块(如 STE 选择器、交叉注意力层),冻结分词器与主干,无需额外监督信号。最终融合图像由解码器从调整后的 2D 特征图重建得到,通常结合残差连接保证视觉保真度。
与同类方法的差异
不同于纯 2D 共享表示或直接使用分词器作为重建主干的方案,本方法通过 1D token 空间解耦全局外观建模,用极简的 token 编辑实现非局部控制,避免了复杂损失设计与全量生成式重建,在局部纹理保留与全局连贯性之间取得了更优的平衡。
实验
实验设计
在四个常用多模态图像融合基准上评估,涵盖红外-可见光、医学影像等模态组合。采用全参考(PSNR、SSIM)与无参考(FID、LPIPS)指标,从局部保真度和全局一致性两个维度衡量。基线包括主流基于 2D 特征网格 的融合方法和基于 Transformer 的全局方法。通过消融实验验证 1D token 界面 和 选择性 token 编辑 (STE) 的贡献。
关键发现
提出的方法在所有基准上取得最佳总体性能,结构保真度和感知质量指标均有一致提升。引入的 1D token 载体 有效建模了非局部外观因素(如全局亮度、色调),使融合图像在全局光照和纹理上更加一致;同时 2D 空间路径 负责细粒度细节恢复,避免模糊或伪影。STE 模块仅稀疏更新少量关键 token,轻量且无需额外损失,即可精确调控全局一致性。
与基线的对比
- vs. 纯 2D 网格方法:在复杂光照场景下全局一致性显著提升,克服了局部感受野导致的块效应或颜色偏移。
- vs. 基于全局 token 的方法:保留了局部细节恢复能力,不会因全局平滑而丢失高频纹理。 通过分离全局外观载体与局部结构路径,本方法在不增加训练负担的前提下实现了更平衡的融合效果。
行业影响
落地场景
该方法将多模态图像融合从传统的 2D 特征网格 重构为 1D 令牌接口,在保留局部纹理的同时大幅提升全局外观一致性。工程上,它极适合需要融合不同成像模态的产品,例如:
- 安防监控:可见光与红外融合,实现日夜全彩且细节清晰的视频输出;
- 医学影像:CT 与 MRI 融合、PET/SPECT 与解剖结构融合,提供更精准的病灶判读;
- 自动驾驶:可见光 + 红外 + 激光雷达强度图融合,增强夜间及恶劣天气下的感知可靠性;
- 遥感监测:多光谱 + 全色融合或 SAR + 光学融合,提高地物分类与变化检测精度。
商业价值与具体 Use Case
该方案通过 轻量级选择性令牌编辑(STE) 机制,无需修改原融合主干或添加额外损失,能够无缝嵌入现有图像处理管线,直接降低集成成本。
增收/体验提升:在电商内容生产中,商品展示常需同时展现外观与材质纹理(如可见光+偏振光),更自然的融合效果可提升用户交互可信度,进而提高转化率。医学影像云平台亦可集成该算法,作为增值服务提供更高质量的融合视图,帮助放射科医生快速定位异常,减少漏诊风险。
降本:冻结的预训练图像分词器使得训练开销极低,且 1D 令牌数量远小于 2D 网格,利于在资源受限的边缘设备(如车载平台、移动医疗终端)部署,省去专用加速硬件的成本。
与现有产品/工作流的接口
该方法的 Token-to-Map 接口 将 1D 令牌解码为 2D 调制图,与现有基于 2D CNN 或 Transformer 的融合 backbone 解耦。集成路径极简:
- 加载冻结分词器 → 输入源图像提取初始令牌;
- 通过 STE 模块(可训练)选择性更新少量令牌;
- 将更新后的令牌映射为空间调制参数,注入原有的 2D 特征融合阶段。
对现有系统只需增加一个轻量级旁路,无需改动主网络结构,可直接应用于已有的
MMIF框架(如EMMA,MambaDFuse),降低技术迁移风险。
局限
- **依赖预训练 tokenizer 的域适应能力**:方法依赖冻结的预训练图像分词器将图像映射到 1D token 空间,该分词器通常在大规模自然图像上训练,当输入来自红外、医学等不同成像机理的模态时,视觉模式与训练分布存在差距,可能导致 token 表示无法准确捕获非局部外观因子,进而影响全局一致性。尽管附录可能讨论了域差距,但本质上限仍受分词器质量影响,需要额外的域适应手段。
- **选择性 token 编辑的容量与敏感度**:STE 仅稀疏地编辑少量关键 token,在高效调控全局外观的同时,其容量可能不足以应对极端、大幅度的外观变化(如强光照迁移、大区域补全)。过少的 token 槽位会限制表达力,而选择阈值与编辑策略可能对性能敏感,需要精细调参,这增加了实际部署中的不确定性。
- **实验对比的充分性**:在四个常用基准上取得 SOTA,但未包含最新基于扩散模型的大规模融合方法对比,也未覆盖更多样化的模态组合(如多光谱、遥感异常检测等)。指标提升虽一致,但可能未充分分析极端场景下的鲁棒性,且定量增益的实用性论证不够深入。