原文链接:[2606.26812] Multi-modality Image Fusion under Adverse Weather: Mask-Guided Feature Restoration and Interaction
author={Li, Xilai and Li, Xiaosong and Tan, Haishu and Ye, Tao and Li, Huafeng and Wang, Hongbin}
Abstract
多通道图像融合(MMIF)通过利用来自不同通道的互补线索来增强场景表示。然而,不利的天气会导致严重的图像退化,扰乱特征表达,并需要同时进行特征恢复和跨模式互补。现有的方法往往难以在这样的条件下进行有效的表征学习,从而限制了它们的实际性能。为了应对这些挑战,我们提出了一种基于模板的MMIF方法,该方法集成了特征恢复和交互。我们首先引入“伪地面真实”来简化训练,促进更快、更有效的特征学习。然后,根据融合结果与源图像之间的映射关系,设计了一种模板生成机制,量化了融合过程中各通道的相对贡献。通过引入所提出的掩蔽引导的跨通道交叉注意机制,鼓励网络在通道交互过程中选择性地关注信息特征,从而降低了过度适应静态分布的“伪地面真相”的风险。此外,我们还提出了掩码引导的学习策略和任务耦合的退化感知学习策略来平衡特征恢复和交互。在合成数据集和真实世界数据集上的广泛实验表明,我们的方法在视觉质量、量化度量和下游任务方面都优于最先进的方法。
Introduction
图1:clean-source-image和“Pseudo Ground Truth”监督下的优化行为比较。
多通道图像融合(MMIF)[8、22、23、36、44、45]结合了来自多个通道的互补信息以产生更丰富的场景表示。例如,在红外和可见光图像融合(IVIF)中,可见光图像捕捉对语义解释至关重要的纹理细节,而红外图像通过热辐射突出突出目标[46]。通过集成这些模式,IVIF增强了下游任务,如对象检测[34]、语义分割[25]和深度估计[27]。
现有的研究[12,13,47]对IVIF架构进行了广泛的研究,主要集中在理想场景上。给定一对配准的红外(IR)和可见光(VI)图像,融合任务通常通过最小化基于L1范数的损失函数来生成融合输出。常规IVIF的优化目标可以表示为:
这里,f(·)表示融合网络,θ表示网络参数,并且λ1、λ2是平衡两种模式的贡献的权重。这一目标使网络能够有效地从多个通道中提取有意义的信息。一些方法[12,46]增加了额外的损失函数,以进一步优化融合性能。
然而,现实世界的复杂性,如噪音[6,14]、恶劣天气[18]和运动模糊[2]对IVIF的适应性构成了巨大的挑战。最近关于这些情况的著作[18,31,43]可以分为两类。第一种模式采用“恢复+融合”模式,每种模式首先由恢复网络处理,然后输入到融合网络中。然而,这种两阶段设计引入了几个问题:(1)恢复侧重于模式内恢复,而融合目标是模式间的互补性,导致不稳定的优化。(2)误差累积:恢复阶段的伪影可能会传播到融合过程中,放大退化的特征并损害重建。
为了解决这些问题,一些研究[9,26,30,38,40]采取了第二种策略,使用“Pseudo Ground Truth”作为监督。具体地说,伪地面真实是指现有方法以干净的VI和IR图像作为监督目标所获得的融合结果。第二种策略的优化目标可以表述如下:
其中,GTPse表示“伪地面真理”。如图1所示,源图像监督使网络在联合特征提取和退化去除方面苦苦挣扎,经常会留下雨纹和颜色失真。相比之下,“伪地面真相”监管简化了优化,并有助于保存全局结构和精细细节。
图2:在干净的场景中,“伪地面真实”监督导致的通道偏差的可视化。
然而,虽然这种方法降低了优化的复杂性,但它不能完全解决复杂场景下的融合挑战,因为现有方法从干净的图像生成的伪地面真实仍然存在信息损失和通道偏差。此外,用“伪地面真相”训练的网络可能会忽视互补的多模式线索,从而削弱了概括性。如图2所示,这种模型在干净的场景中未充分利用红外热信息,导致关键目标区域的损失。这突出了一个关键的局限性:该策略适合伪目标的静态分布,而不是学习IVIF的动态机制。这提出了一个关键问题:我们能否利用“伪地面真相”的优势,同时使网络能够动态挖掘跨模式信息,并保持对降级的感知?
针对这些问题,我们提出了一种基于面罩引导的恶劣天气图像融合框架(AMG-FUSE)。我们首先分析源图像和融合结果之间的关系,并推导出一种掩模表示来解耦融合图像中的特定于模态的分量。该掩码将多模式特征分离在“伪地面真相”中,并作为训练过程中显式跨模式交互建模的外部先验,鼓励网络学习动态融合过程。在此基础上,设计了掩码制导的特征提取模块,利用掩码恢复退化特征,增强跨模式交互。在训练过程中,掩码引导学习策略(MGLS)和任务耦合退化感知学习策略(TDAS)协同监督融合网络,促进学习更清晰和更互补的特征表示。我们的主要贡献如下:
-我们提出了一种适用于复杂场景的统一的多通道图像融合方法,可以在统一的网络中同时进行特征恢复和通道交互。
-我们提出了一种掩码引导的特征提取模块,有效地重建了融合特征。此外,我们设计了一种掩码引导的网络学习策略来解决动态跨通道交互建模的不足。
-我们提出了一种任务耦合的退化感知学习策略,该策略利用恢复任务作为有意义的监督信号来增强退化感知并指导特征融合过程。
-我们在三种恶劣天气条件下进行了广泛的实验,以验证所提出的方法的有效性,并通过下游任务展示了其在现实世界中应用的潜力。
2 Related Works
2.1 Learning based IVIF Methods
深度学习的最新进展极大地促进了IVIF算法的发展[3,28,48]。现有的理想条件下的研究主要集中在跨通道信息交互[12,21,28,46],统一融合框架设计[4,19,37,49],以及任务驱动优化[1,20,32,35,39]。跨通道交互通常使用特征提取程序,例如卷积或自我注意,以区分共享和特定通道的提示,以实现有效的融合。例如,赵等人。[46]设计了一种相关性驱动的双分支变压器-CNN,以分离全局和局部特征并保留显著细节。随着数据集的增加和计算能力的增强,统一的面向下游的融合框架受到了越来越多的关注,如Wu等人。[35]将细分任何模型提取到融合网络中。
2.2 IVIF Methods for Complex Scenes
现实环境的复杂性给IVIF算法在实际应用中带来了巨大的挑战。除了理想条件下的融合任务,研究人员还将他们的重点转移到复杂条件下的图像融合上,如噪声、过度曝光和不利天气。复杂场景中的首要挑战不仅是实现跨模式交互,而且要准确区分有用的特征和退化特征,并确保有效的恢复。例如,Yi等人。[41]提出了一种以语义文本为导向的退化感知交互融合算法,利用文本信息作为外部先验,帮助网络聚焦于已有的退化。Li等人。[18]结合物理模型,提出了一种全天候IVIF算法,通过精馏学习将各种先验知识融入到学生模型中。虽然上述方法[18,31,41]在复杂场景下的融合研究取得了很大进展,但它们主要侧重于特征恢复,没有充分探索复杂融合与理想融合之间的范式差距。
3 Proposed Method
该算法的工作流程如图3所示。首先,使用卷积和残差块来增强输入图像的特征表示。然后对提取的多模式特征进行组合以生成初始融合特征。随后,残差块进一步提炼特定于通道的特征,而融合后的特征由直方图变换器块(HTB)[29]处理以提取显著信息。HTB根据像素强度分割空间特征,并将自我关注应用到不同的强度范围,使其能够在长空间距离上捕获类似的退化模式[29]。最后,利用MCCA模块对多模式特征和融合特征进行联合细化,得到最终的融合图像。
图3:提出的方法的流程图。
3.1 Mask Construction from Fusion Formulation
虽然“伪地面真实”的引入可以简化训练过程,但它也可能导致网络直接复制其特征,而不是学习其所传达的底层通道分配知识。为了克服这一限制,我们通过引入面具来将其解耦。IVIF任务的核心目标是抑制跨通道冗余,有效地提取互补信息。在不考虑特征增强和减少的情况下,融合结果(FUSE)可以表示为:
这里,M表示用于特定于通道的权重分配的掩码,而ε表示误差和噪声项。在已知熔丝、VI和IR的情况下,M的卷积RSB卷积RSB RSB HTB RSB MfeM Sigmoid Gap RSB Sigmoid Conv Relu Conv表达式可推导为:
在现实世界中,直接从可见光图像中减去红外图像可能会导致误导或不稳定的行为。在雾霾或下雪的情况下,可见光图像通常表现出过度或局部过度曝光的亮度,而红外图像则表现出对比度降低和像素值较低。经过网络优化和退化去除后,融合后的输出增强了来自红外分量的结构和目标信息,从而产生更稳定的(FUSE−IR)分布,更好地反映真实场景亮度。然而,由于公式4的分母中的亮度偏差是由来自可见图像而不是语义内容的退化因素驱动的,所以退化信息主导了加权,违反了掩模的去耦合原则,并且阻止了它捕捉实际的模式分布。相反,在夜间场景中,由于光照不足,可见图像包含的有效纹理最少,而红外图像保持相对稳定,可能会呈现更强的亮度提示。这会导致(VI−IR)在大范围内为负或接近于零,使得公式4在生成掩模时在数值上不稳定。为了解决这个问题,我们重写M的表达式,如下所示:
图4:通道贡献模板和特征分解的可视化。
将Fuse信息引入分母中,有效地防止了可见光图像的亮度偏差错误地放大了掩模,避免了分母中的极端数值不稳定性。最后,利用M,我们可以获得不同融合算法对不同模式信息的表示。如图4所示,我们可视化了构造的掩码和分离的多模式特征。该方法通过引导网络学习多通道信息在“伪地面真实”中的分布模式,动态地对各通道的贡献进行建模,避免了对整体场景的表面拟合。
3.2 Mask Guided Feature Extraction Module
直接对伪目标进行训练可能会导致网络复制其固有的偏见,强调表面特征复制而不是有效的跨模式交互。为了解决这一问题,我们提出了掩码引导的特征提取模块。
首先,将多模特征输入残差块(RSB),然后将融合后的特征传递给直方图变换块(HTB)进行优化。然后将得到的输出用于计算掩码M。MCCA模块的提出是为了使网络能够学习“伪地面真相”的多模式交互模式。MCCA采用交叉注意机制,其中多通道特征作为掩码引导的查询,而融合的特征作为关键字和值。为了改进局部信息建模,在查询分支和键值分支中都引入了深度可分离卷积,以扩展局部接受域。然后,掩码被用来对查询QVI和QIR进行加权,引导网络将重点放在每个通道中的重要特征上。这使得融合空间内的多模式特征能够解耦和重新组合。
3.3 Mask Guided Learning Strategy
为了更好地利用“伪地面真实”来学习多通道交互特征,我们提出了一种掩蔽引导学习策略(MGLS)。具体地说,如公式5所示,掩码MPSE是基于“伪地真值”(GTPse)和干净的多通道源图像VIC和IRC来计算的。然后,该掩码用于在“伪地真值”中去耦合多通道特征FVI和FIR。
这里,F_{VI}和F_{IR}是GT_{\mathm{pse}}中的通道分配图。然后,我们计算相应的多模式特征的L1损失,以约束网络学习“伪地面真实”中的多模式信息分布模式。给定网络输出的多峰特征为HAT{F}_{VI}和\HAT{F}_{IR},建议的MGLS损失(数学上的{L}_{MGLS})计算如下:
其中H和W分别表示图像的高度和宽度。
3.4 Task-Coupled Degradation-Aware Learning Strategy
图5:可见特征重加权中掩码引导的退化抑制的可视化。
公式3定义了传统图像融合的合成范例。因此,在确定掩码后,可以间接获得现有方法针对不同模式信息的分配策略。在复杂场景中,两个输入图像(Videg和IRDeg)经常会降级。在这一点上,融合网络的目标是输出包含互补的多模特征的清晰的融合结果。这一过程可以使用公式3进行类似的建模。
由于FUSE是非退化图像,因此公式8中的MDeg×Videg所获得的可见模式信息应该是无退化的。因此,该掩模可以有效地捕捉退化区域的分布。这如图5所示,它显示大多数雨带已被成功抑制或移除。基于以上观察结果,我们提出了任务耦合的退化感知学习策略(TDAS),旨在引导融合网络将处理的优先级划分得更清晰、更突出。对于恢复任务,当输入图像是无退化的时,恢复网络倾向于生成与原始图像非常相似的输出。因此,我们将TDAS损失定义如下:
其中R(·)表示恢复模型[42],并且。当VIF与恢复网络的输出R(VIF)足够相似时,意味着融合网络已经有效地恢复了清晰的特征。
3.5 Loss Functions
在训练过程中,除了MGLS和TDAS之外,还进一步引入了源图像监督,通过对融合输出施加约束来增强模型捕获多峰分布的能力。具体地说,我们采用梯度损失和颜色一致性损失来分别保持结构细节和颜色分布的一致性。梯度损耗定义如下:
颜色一致性损失[41]表示如下,
其中,FCbCr表示将图像空间转换到CBCR颜色空间的函数。总损失函数表示如下,
其中λ是衰减系数,随着训练周期数的增加而逐渐减小。除LMGLS外的所有损失项的权重都被指定为1,确保了来自渐变和颜色一致性约束的平衡贡献,而不需要仔细的超参数调整。