【图像去雾】论文精读:DEA-Net: Single image dehazing based on detail-enhanced convolution and content-guided at
请先看【专栏介绍文章】:
前言
论文题目:DEA-Net: Single image dehazing based on detail-enhanced convolution and content-guided attention —— DEA-Net:基于细节增强卷积和内容引导注意的单幅图像去雾
论文地址:DEA-Net: Single image dehazing based on detail-enhanced convolution and content-guided attention
论文源码:https://github.com/cecret3350/DEA-Net
TIP 2024!
Abstract
单幅图像去雾是一个具有挑战性的问题,它从观测到的雾霾图像估计潜在的无雾图像。现有的一些基于深度学习的方法致力于通过增加卷积的深度或宽度来提高模型的性能。卷积神经网络 (CNN) 结构的学习能力仍未得到充分探索。本文提出了一种由细节增强卷积(DEConv)和内容引导注意(CGA)组成的细节增强注意块(DEAB),以提高特征学习以提高去雾性能。具体来说,DEConv 将先验信息集成到正常卷积层中,以增强表示和泛化能力。然后通过使用重新参数化技术,DEConv 等效地转换为具有 NO 额外参数和计算成本的普通卷积。通过将独特的空间重要性图 (SIM) 分配给每个通道,CGA 可以关注特征中编码的更多有用信息。此外,提出了一种基于 CGA 的混合融合方案来有效地融合特征并帮助梯度流。通过结合上述组件,我们提出了细节增强注意力网络(DEA-Net)来恢复高质量的无雾图像。大量的实验结果证明了我们的DEA-Net的有效性,通过仅用3.653 M参数将PSNR指数提高到41 dB,优于最先进的(SOTA)方法。
I. INTRODUCTION
在朦胧场景下捕获的图像通常会出现对比度或颜色失真明显的视觉质量退化[1],导致输入到一些高级视觉任务(如目标检测、语义分割)时性能下降显著。在这些任务中,高度需要或需要无雾的图像。因此,旨在从相应的模糊图像中恢复干净场景的单幅图像去雾在过去十年中在学术界和工业界都引起了极大的关注。作为一个基本的低级图像恢复任务,图像去雾可能是后续高级视觉任务的预处理步骤。在本文中,我们尝试开发一种有效的算法来去除雾霾,并从模糊的输入中恢复细节。
最近,随着深度学习的快速发展,基于卷积神经网络(CNN)的去雾方法取得了更好的性能[2]-[6]。早期的基于cnn的方法[2]、[7]、[8]首先分别估计透射图和大气光,然后利用大气散射模型(ASM)[9]推导出无雾图像。通常,传输图由地面实况监督,用于合成训练数据集。然而,对透射图或大气光的估计不准确会显著影响图像恢复结果。最近,一些方法 [6]、[10]、[11] 倾向于以端到端的方式预测潜在的无雾图像,因为它往往会取得有希望的结果。
然而,仍然存在两个主要问题:
(1)普通卷积的有效性较低。以前的工作[12]-[14]证明了设计良好的先验,如暗通道先验[12]、[15]、非局部雾霾线先验[13]和颜色衰减先验[14],有助于恢复缺失的信息。现有的去雾方法[5],[6],[16]大多采用经典的卷积层进行特征提取,而不使用这些先验。然而,香草卷积在没有任何约束的情况下搜索广阔的解空间,这在某种程度上,可能会限制表达能力(或建模能力)。此外,一些基于变压器的方法[17]将接受域扩展到整个图像,挖掘长距离依赖关系。它们可以以复杂的训练策略和繁琐的超参数调整为代价来增强表达能力(或建模能力)。此外,无法忽略高昂的计算成本和巨大的 GPU 内存占用。在这方面,理想的解决方案是将精心设计的先验嵌入到 CNN 中,以提高特征学习能力。
(2) 雾霾不均匀性。去雾问题有两种不均匀性:图像级的雾霾分布不均匀和特征级的通道雾霾差。为了应对第一个,Qin et al.[5]采用像素注意(即空间注意)生成空间重要性图(SIM),它可以自适应地指示不同像素位置的重要性级别。通过这种判别策略,FFA-Net 模型不平等地对待薄而厚的雾霾区域。同样,Ye等人[11]试图通过密度估计模块对雾霾分布的密度进行建模,该模块本质上也是一个空间注意。然而,很少有研究人员关注特征级别的非均匀性,这仍未得到利用。[5] 中使用的通道注意力可以产生通道注意力向量 1 来表示每个通道的重要性级别,这没有考虑空间维度中的上下文信息。在应用卷积层后,将雾霾信息编码到特征图中。根据所应用的过滤器的作用,特征空间中的不同通道具有不同的含义。在这方面,我们认为空间重要性图应该是特定于通道的,同时考虑两种非均匀性(图像级和特征级)。
为了解决上述问题,我们设计了一个细节增强注意块(DEAB),它由细节增强卷积(DEConv)和内容引导注意(CGA)机制组成。DEConv 包含五个卷积层(四个差分卷积 [18] 和一个普通卷积),它们并行用于特征提取。具体来说,采用中心差分卷积(CDC)、角差卷积(ADC)、水平差卷积(HDC)和垂直差分卷积(VDC)将传统的局部描述符集成到卷积层中,从而增强表示和泛化能力。在差分卷积中,首先计算图像中的像素差异,然后与卷积核进行卷积以生成输出特征图。像素对差异计算的策略旨在明确地将先验信息编码到 CNN 中。例如,HDC 和 VDC 通过学习有益的梯度信息明确地将梯度先验编码到卷积层中。
此外,复杂的注意力机制(即 CGA)是一个两步注意力生成器,它首先可以产生粗略的空间注意力图,然后对其进行细化到精细版本。具体来说,给定特定的输入特征映射,我们利用[19]中提出的空间注意机制和[20]中提出的通道注意来生成初始SIMs(即粗版本)。然后,根据输入特征图的每个通道细化初始 SIM 以产生最终的 SIM。通过使用输入特征的内容来指导 SIM 的生成,CGA 可以专注于每个通道中特征的唯一部分。值得一提的是,CGA作为通用基本块可以插入到神经网络中,以提高各种图像恢复任务的性能。

除了上述改进外,我们还重新参数化了并行卷积的学习核权重,以减少参数的数量,加快训练过程。五个并行卷积被简化为一个普通卷积层,对内核权重应用一些约束,并使用卷积层的线性特性。因此,所提出的 DEConv 可以提取丰富的特征来提高去雾性能,同时保持参数数量和计算成本等于普通卷积。图 1 显示了我们方法的效率和有效性。
在[6]、[10]、[21]、[22]之后,我们还采用了类似U-net的框架,使低分辨率空间中主要的耗时的卷积计算成为可能。其中,浅层和深层特征的融合被广泛使用。特征融合可以增强从浅层到深层的信息流,这对于特征保持和梯度反向传播是有效的。浅层特征中编码的信息与深度特征中编码的信息有很大不同,因为感受野不同。深度特征中的一个像素来自浅层特征中的像素区域。简单的加法或连接操作无法解决感受野不匹配问题。我们进一步提出了一种基于 CGA 的混合方案,通过通过学习的空间权重调制特征,自适应地将编码器部分中的低级特征与相应的高级特征融合。
我们提出的方法示意图如图2所示。我们通过引入细节增强注意块(DEAB)和内容引导注意,将所提出的单幅图像去雾模型称为DEA-Net。
总而言之,我们做出了以下贡献:
- 我们设计了一个细节增强卷积 (DEConv),其中包含并行 vanilla 和差分卷积。据我们所知,这是第一次引入差分卷积来解决图像去雾问题。通过将先验信息编码到正常卷积层中,提高了DEConv的表示能力和泛化能力,以提高去雾性能。此外,我们通过使用重新参数化技术等效地将 DEConv 转换为具有 NOextra 参数和计算成本的法线卷积。
- 我们提出了一种新的注意力机制,称为内容引导注意力 (CGA),以从粗到细的方式生成特定于通道的 SIM。通过使用输入特征指导 SIM 的生成,CGA 为每个通道分配唯一的 SIM,使模型关注每个通道的显着区域。因此,可以强调在特征中编码的更多有用信息以有效提高性能。此外,提出了一种基于 CGA 的混合融合方案,有效地将编码器部分中的低级特征与相应的高级特征融合。
- 结合 DEConv 和 CGA,并使用基于 CGA 的混合融合方案,我们提出了我们的细节增强注意力网络 (DEA-Net) 来重建高质量的无雾图像。DEA-Net在多个基准数据集上表现出比最先进的去雾方法更好的性能,以更快的推理速度实现了更准确的结果。
本文的其余部分安排如下。我们首先在第二节回顾了一些基于深度学习的去雾方法。第三节详细描述了所提出的EDA-Net模型,第四节给出了实验结果。最后,第五节总结了本文。
II. RELATED WORK
A. Single Image Dehazing
对于单幅图像去雾,现有的方法主要可以分为两类。一种是手动将模糊图像和无雾图像之间的统计差异概括为经验先验。另一个旨在直接或间接学习基于大规模数据集的映射函数。我们通常将前者称为基于先验的方法,后者称为数据驱动方法。
基于先验的方法是图像去雾的先驱。它们通常依赖于大气散射模型(ASM)[9]和手工先验。广为人知的先验包括暗通道先验(DCP)[12]、[15]、非局部先验(NLP)[13]、颜色衰减先验(CAP)[14]等。他等人。[12],[15]提出了一种基于关键观测的DCP–无雾霾室外图像中大多数局部斑块包含一些在至少一个颜色通道中具有非常低的强度的像素,这有助于估计传输图。CAP[14]从HSV颜色模型开始,建立深度和亮度和饱和度差异之间的线性关系。Berman等人[13]发现,当雾霾出现时,无雾图像的像素簇将成为雾霾线。这些基于先验的方法取得了可喜的去雾结果。然而,它们往往只有在恰好满足假设的特定场景中才能很好地工作。
最近,随着深度学习的兴起,研究人员专注于数据驱动的方法,因为它们可以获得更好的性能。早期的数据驱动方法通常基于物理模型执行去雾。例如,DehazeNet [2] 和 MSCNN [7] 利用 CNN 来估计传输图。然后,AOD-Net [3] 重写 ASM 并估计大气光以及传输图。后来,DCPDN[8]通过两个不同的网络估计透射图和大气光。然而,传输图和大气光估计不准确带来的累积误差可能会导致性能下降。
为了避免这一点,最近的工作倾向于在物理模型的帮助下直接从模糊图像中恢复无雾图像。GFN [23] 门并融合来自原始朦胧输入的三个增强图像以生成无雾图像。GridDehazeNet[24]利用三阶段注意的网格网络来恢复无雾的图像。MSBDN[10]利用boosting策略和反投影技术来增强特征融合。FFA-Net [5] 将特征注意机制 (FAM) 引入去雾网络来处理不同类型的信息。AECR-Net [6] 重用特征注意块 (FAB) [5] 并提出了一种新颖的对比正则化,可以从正样本和负样本中受益。UDN[22]分析了图像去雾中的两种类型的不确定性,并利用它们来提高去雾性能。PMDNet[11]和Dehamer[17]采用变压器建立远程依赖,在雾霾密度的指导下进行去雾。然而,随着数据驱动方法的发展和去雾性能的提高,去雾网络的复杂性也会增加。与以往的工作不同,我们重新思考了香草卷积在图像去雾方面的不足,设计了一种新的卷积算子,将精心设计的先验结合到CNN中,以提高特征学习能力。我们还更深入地研究了特征级雾霾的未利用非均匀性。
B. Difference Convolution
差分卷积的起源可以追溯到局部二值模式(LBP)[25],它将局部patch中的像素差异编码为十进制数字进行纹理分类。由于cnn在计算机视觉领域的成功,Xu等人[26]提出了局部二值卷积(LBC),利用非线性激活函数和线性卷积层对像素差异进行编码。最近,Yu等人[27]提出了中心差分卷积(CDC),以直接编码具有完全可学习权值的像素差异。后来,人们提出了各种形式的差分卷积,如交叉中心差分卷积[28]和像素差分卷积[29]。考虑到差分卷积捕获梯度级信息的性质,我们首先将其引入单幅图像去雾以提高性能。
III. METHODOLOGY
如图2所示,我们的DEA-Net由三部分组成:编码器部分、特征变换部分和解码器部分。作为DEA-Net的核心,特征变换部分采用堆叠的细节增强注意块(DEABs)来学习无雾的特征。层次结构中有三个级别,我们在不同级别使用不同的块来提取相应的特征(级别 1&2: DEB,级别 3:DEAB)。给定一个模糊输入图像I∈R3×H×W,DEA-Net的目标是恢复相应的无雾图像J∈R3×H×W。

A. Detail-enhanced Convolution
在单幅图像去雾领域,以往的方法[5],[6],[16]通常采用香草卷积(VC)层进行特征提取和学习。正常卷积层在没有任何约束的情况下搜索广阔的解空间(甚至从随机初始化开始),限制了表达能力或建模能力。然后我们注意到高频信息(例如边缘和轮廓)对于恢复在朦胧场景捕获的图像具有重要意义。在此基础上,一些研究人员[8]、[21]、[30]在去雾模型中采用边缘先验来帮助恢复更清晰的轮廓。受他们的工作[8]、[30]的启发,我们设计了一个细节增强卷积(DEConv)层(见图3),它可以将设计良好的先验集成到普通卷积层中。

在详细阐述所提出的 DEConv 之前,我们首先回顾一下差分卷积 (DC)。以前的工作[27]-[29],[31]通常将差分卷积描述为像素差的卷积(首先计算像素差,然后与核权值进行卷积生成特征映射),可以增强香草卷积的表示和泛化能力。中心差分卷积(CDC)和角差卷积(ADC)是两种典型的DC,通过重新排列学习的核权重来实现,以节省计算成本和内存消耗[29]。它被证明对边缘检测[29]和人脸反欺骗任务[27]、[28]、[31]有效。据我们所知,这是第一次引入DC来解决单幅图像去雾问题。

在我们的实现中,我们使用了五个卷积层(四个 DC [18] 和一个 vanilla 卷积),它们并行用于特征提取。在 DC 中,像素对差异计算的策略可以设计为将先验信息显式编码为 CNN。对于我们的DEConv,除了中心差分卷积(CDC)和角差卷积(ADC)外,我们还推导了水平差分卷积(HDC)和垂直差分卷积(VDC),将传统的局部描述符(如Sobel[32]、Prewitt[33]或Scharr[34])集成到卷积层中。如图4所示,以HDC为例,首先通过计算所选像素对的差异来计算水平梯度。训练后,我们等效地重新排列学习到的内核权重,并直接将卷积应用于未触及的输入特征。请注意,等效内核具有传统局部描述符的类似格式(水平权重之和等于零)。Sobel[32]、Prewitt[33]和Scharr[34]的水平核可以是被视为等效内核的特例。VDC 通过将水平梯度更改为相应的垂直梯度具有相似的推导。HDC 和 VDC 都明确地将梯度先验编码到卷积层中,通过学习有益的梯度信息来增强表示和泛化能力。
在我们的设计中,vanilla 卷积用于获得强度级信息,而差分卷积用于增强梯度级信息。我们只需将学习到的特征相加,得到DEConv的输出。我们信任更复杂的计算像素差异的方法设计可以进一步有利于图像恢复任务,这不是本文的主要方向。
然而,部署五个并行卷积层进行特征提取将不希望地导致参数和推理时间的增加。我们试图利用卷积层的可加性,将并行部署的卷积简化为单个标准卷积。我们注意到卷积的有用属性:如果几个大小相同的 2D 内核在相同的输入上运行,具有相同的步幅和填充以产生输出,并且它们的输出相加以获得最终输出,我们可以在相应的位置添加这些内核以获得产生相同最终输出的等效内核。令人惊讶的是,我们的 DEConv 完全符合这种情况。给定输入特征Fin,DEConv可以利用重新参数化技术将具有相同计算成本和推理时间的Fout输出到普通卷积层。公式如下(简化省略了偏差):
F
out
=
DEConv
(
F
in
)
=
∑
i
=
1
5
F
in
∗
K
i
=
F
in
∗
(
∑
i
=
1
5
K
i
)
=
F
in
∗
K
c
v
t
(1)
\begin{aligned} F_{\text {out }} & =\operatorname{DEConv}\left(F_{\text {in }}\right)=\sum_{i=1}^{5} F_{\text {in }} * K_{i} \\ & =F_{\text {in }} *\left(\sum_{i=1}^{5} K_{i}\right)=F_{\text {in }} * K_{c v t} \end{aligned}\tag{1}
Fout =DEConv(Fin )=i=1∑5Fin ∗Ki=Fin ∗(i=1∑5Ki)=Fin ∗Kcvt(1)
其中DEConv(·)表示我们提出的DEConv的操作,Ki=1:5分别表示VC、CDC、ADC、HDC和VDC的核,*表示卷积运算,Kcvt表示转换后的核,将并行卷积组合在一起。

图5直观地显示了重新参数化技术的过程。在反向传播阶段,使用梯度传播的链式法则分别更新五个并行卷积的内核权重。在前向传播中阶段,并行卷积的内核权重是固定的,转换后的内核权重是通过在相应的位置上添加它们来计算的。请注意,重新参数化技术可以同时加速训练和测试过程,因为它们都包含前向传播阶段。
与普通卷积层相比,所提出的 DEConv 可以在保持参数大小的同时提取更丰富的特征,在推理阶段没有额外的计算成本和内存负担。关于DEConv的更多讨论可以在SEC中找到。IV-C1。
B. Content-guided Attention
特征注意模块(FAM)由通道注意和空间注意组成,依次放置空间注意来计算通道和空间维度上的注意权重。通道注意力计算通道向量,即 Wc ∈ RC×1×1,以重新校准特征。空间注意计算空间重要性图(SIM),即Ws∈RH×W,自适应地表示不同区域的重要性水平。FAM 对不同的通道和像素进行不平等处理,提高了去雾性能。
然而,FAM内部的空间注意只能解决图像级别的不均匀雾霾分布,而忽略了特征级别的分布不均匀。FAM 内的通道注意力对通道差异进行建模,而不考虑上下文信息。随着特征通道的扩展,图像级雾霾分布信息被编码到特征图中。根据所应用的过滤器的作用,特征空间中的不同通道具有不同的含义。这意味着对于每个特征通道,雾霾信息在空间维度上分布不均匀。在这种情况下需要特定于通道的 SIM。此外,FAM 的另一个问题是这两个注意力权重之间没有信息交换。Wc 和 Ws 依次计算并单独增强特征。
为了充分解决上述问题,我们提出了一种内容引导注意(CGA),以粗到细的方式获得输入特征的每个单独通道的独占SIM,同时充分混合通道注意权重和空间注意权重以保证信息交互。CGA的详细过程如图6所示,设X∈RC×H×W表示正在进行的输入特征,CGA的目标是生成通道特定的SIMs(即W∈RC×H×W),其维数与X相同。
我们首先通过以下方式计算相应的 Wc 和 Ws [19]、[20]。
W
c
=
C
1
×
1
(
max
(
0
,
C
1
×
1
(
X
G
A
P
c
)
)
)
,
W
s
=
C
7
×
7
(
[
X
G
A
P
s
,
X
G
M
P
s
]
)
,
(2)
\begin{aligned} W_{c} & =\mathcal{C}_{1 \times 1}\left(\max \left(0, \mathcal{C}_{1 \times 1}\left(X_{G A P}^{c}\right)\right)\right), \\ W_{s} & =\mathcal{C}_{7 \times 7}\left(\left[X_{G A P}^{s}, X_{G M P}^{s}\right]\right), \end{aligned}\tag{2}
WcWs=C1×1(max(0,C1×1(XGAPc))),=C7×7([XGAPs,XGMPs]),(2)
其中 max(0, x) 表示 ReLU 激活函数,Ck×k(·) 表示具有 k × k 内核大小的卷积层,[·] 表示通道连接操作。Xc GAP、Xs GAP 和 Xs GM P 分别表示通过空间维度上的全局平均池化操作、通道维度上的全局平均池化操作和通道维度上的全局最大池化操作处理的特征。为了减少参数的数量并限制模型的复杂性,第一个 1×1 卷积将通道维度从 C 降低到 C r(r 表示缩减率),第二个 1×1 卷积将其扩展为 C。在我们的实现中,我们选择通过将 r 设置为 C16 将通道维度减少到固定值(即 16)。
然后我们通过简单的加法操作(遵循广播规则)将 Wc 和 Ws 融合在一起,以获得粗略的 SIMs Wcoa ∈ RC×H×W。我们通过实验发现产品操作可以达到类似的结果。
W
c
o
a
=
W
c
+
W
s
,
(3)
W_{c o a}=W_{c}+W_{s},\tag{3}
Wcoa=Wc+Ws,(3)
为了获得最终的细化 SIMs W ,Wcoa 的每个通道根据相应的输入特征进行调整。我们利用输入特征的内容作为指导来生成最终的特定于通道的 SIMs W。特别是,Wcoa 和 X 的每个通道都通过通道混洗操作 [35] 以交替方式重新排列。
W
=
σ
(
G
C
7
×
7
(
C
S
(
[
X
,
W
coa
]
)
)
)
(4)
W=\sigma\left(\mathcal{G} \mathcal{C}_{7 \times 7}\left(C S\left(\left[X, W_{\text {coa }}\right]\right)\right)\right)\tag{4}
W=σ(GC7×7(CS([X,Wcoa ])))(4)
其中 σ 表示 sigmoid 操作,CS(·) 表示通道混洗操作,GCk×k(·) 表示具有 k × k 内核大小的组卷积层,在我们的实现中,组数设置为 C。
CGA 为每个通道分配唯一的 SIM,引导模型专注于每个通道的显着区域。因此,可以强调在特征中编码的更多有用信息来有效地提高去雾性能。
如图2右侧所示,将提出的DEConv与CGA相结合,提出了DEA-Net的主要块,即细节增强注意块(DEAB)。通过去除CGA部分,我们得到了细节增强块(DEB)。
C. CGA-based Mixup Fusion Scheme
在[6]、[10]、[21]、[22]之后,我们对DEA-Net采用了类似编码器解码器(或类似U-Net)的体系结构。我们观察到,将编码器部分的特征与来自解码器部分的特征融合是去雾和其他低级视觉任务 [6]、[10]、[36]、[37] 的有效技巧。低级特征(例如边缘和轮廓),在恢复无雾图像方面具有不可忽略的作用,在经过许多中间层后逐渐失去其影响。特征融合可以增强从浅层到深层的信息流,有利于特征保留和梯度反向传播。最简单的融合方法是逐元素加法,这在许多以前的方法 [10]、[11]、[21] 中采用。后来,吴等人。 [6] 应用自适应混合操作通过自学习权重来调整融合比例,这比加法更灵活。
然而,上述融合方案存在感受野不匹配问题。浅层特征中编码的信息与深度特征中编码的信息有很大不同,因为它们具有完全不同的感受野。深度特征中的一个像素来自浅层特征中的像素区域。简单的加法或连接操作或混合操作无法在融合之前解决不匹配问题。
为了缓解这个问题,我们进一步提出了一种基于 CGA 的混合方案,通过通过学习的空间权重调制特征,自适应地将编码器部分中的低级特征与相应的高级特征融合。
图 2 (d) 显示了所提出的基于 CGA 的混合融合方案的细节。核心部分是我们选择使用 CGA 来计算特征调制的空间权重。将编码器部分和相应的高级特征中的低级特征输入 CGA 以计算权重,然后通过加权求和方法组合。我们还通过跳跃连接添加输入特征以减轻梯度消失问题并简化学习过程。最后,融合特征由 1×1 卷积层投影以获得最终特征(即 Ff 使用)。
F
fuse
=
C
1
×
1
(
F
low
⋅
W
+
F
high
⋅
(
1
−
W
)
+
F
low
+
F
high
)
,
(5)
F_{\text {fuse }}=\mathcal{C}_{1 \times 1}\left(F_{\text {low }} \cdot W+F_{\text {high }} \cdot(1-W)+F_{\text {low }}+F_{\text {high }}\right),\tag{5}
Ffuse =C1×1(Flow ⋅W+Fhigh ⋅(1−W)+Flow +Fhigh ),(5)
关于基于cga的混合融合方案的更多讨论见第IV-C3节。
D. Overall Architecture
通过将(1)DEConv,(2)CGA和(3)基于CGA的混合融合方案结合在一起,我们提出了DEA-Net和DEAB作为基本块。如图 2 所示,我们的 DEA-Net 是一种三级编码器-解码器类(或类似 UNet)架构,由三部分组成:编码器部分、特征变换部分和解码器部分。我们的DEA-Net有两个下采样操作和两个上采样操作。下采样操作将空间维度减半,并使通道数加倍。通过将步幅值设置为 2 并将输出通道的数量设置为输入通道的 2 倍,通过普通卷积层实现。上采样操作可以看作是下采样操作的逆形式,它是通过反卷积层实现的。级别 1、级别 2 和级别 3 的维度大小分别为 C × H × W、2C × H2 × W2 和 4C × H4 × W4。在我们的实现中,我们将 C 的值设置为 32。以前的方法 [6]、[22] 仅在低分辨率空间中转换特征,导致信息丢失,这对于去雾等细节敏感任务并非易事。不同的是,我们将特征提取块从级别1部署到级别3。具体地说,我们选择在不同的级别使用不同的块(级别1&2:DEB,级别3:DEAB)。对于特征融合,我们在上采样操作之前融合下采样操作和相应特征后的特征(在图 2 中用绿色箭头线突出显示)。最后,我们只需在末尾使用 3×3 卷积层来获得去雾结果 J。
通过最小化预测的无雾图像 J 和相应的地面实况 GT 之间的像素级差异来训练 DEA-Net。在我们的实现中,我们选择 L1 损失函数(即平均绝对误差)来驱动训练。
L
L
1
=
∥
J
−
G
T
∥
1
,
(6)
\mathcal{L}_{L 1}=\|J-G T\|_{1},\tag{6}
LL1=∥J−GT∥1,(6)
IV. EXPERIMENT
A. Datasets and Metrics
数据集。在我们的实现中,我们在合成和真实捕获数据集上训练和测试我们提出的DEA-Net。相对论单幅图像去雾(RESIIDE)[38]是一个广泛使用的数据集,包含五个子集:室内训练集(ITS)、室外训练集(OTS)、综合目标测试集(SOTS)、现实任务驱动测试集(RTTS)和混合主观测试集(HSTS)。我们选择训练阶段的ITS和OTS,在测试阶段选择SOTS。请注意,SOTS 分为两个子集(即 SOTS-indoor 和 SOTS-outdoor),用于评估在 ITS 和 OTS 上训练的模型。ITS包含1399张室内干净图像和每个干净图像,基于物理散射模型生成10张模拟模糊图像。至于 OTS,我们为训练过程 2 选择了大约 296K 图像。 SOTS-indoor 和 SOTS-outdoor 分别包含 500 个室内和 500 个室外测试图像。此外,Haze4K 数据集 [39] 包含 3000 个合成训练图像和1000张合成测试图像也被用来评估我们的DEA-Net。此外,利用一些真实捕获的模糊图像进一步验证了真实场景的有效性。
评估指标。利用通常用于测量计算机视觉社区图像质量的峰值信噪比(PSNR)和结构相似性指数(SSIM)[40]进行去雾性能评估。为了公平比较,我们基于 RGB 彩色图像计算指标,而无需裁剪像素。
B. Implementation Details
我们在具有单个 NVIDIA RTX3080Ti GPU 的 PyTorch 深度学习平台上实现了所提出的 DEA-Net 模型。我们将 DEB、DEB 和 DEAB 分别部署在级别 1、级别 2 和级别 3 中。部署在不同阶段的块数 [N1, N2, N3, N4, N5] 设置为 [4, 4, 8, 4, 4]。采用Adam[41]优化器对DEA-Net进行优化,β1、β2、ε设为默认值,即0.9、0.999、1e−8。初始学习率设置为1e−4和16。采用余弦退火策略[42]将学习率从初始值调整为1e−6。为了训练模型,我们从大小为256×256的原始图像中随机裁剪补丁,然后采用两种数据增强技术,包括:90◦或180◦或270◦旋转和垂直或水平翻转。在整个训练过程中,该模型训练了 1500K 次迭代,在 ITS 上训练我们的 DEA-Net大约需要 5 天。
C. Ablation Study
为了证明我们提出的DEANet的有效性,我们研究了(1)细节增强卷积(DEConv),(2)内容引导注意(CGA)和(3)基于cga的混合融合方案的设计和效果。通过消融实验分析各组分的贡献。

1)DEConv:我们首先通过在第3级部署经典剩余块(RB)[43]来构建基线模型,该模型记为Base RB。作为去雾领域中常用的基本块,我们还在第 3 级采用了 [5] 中的特征注意块 (FAB)。超参数设置为原始论文中描述的默认值。我们将此模型称为我们的第二个基线 Base FAB。
为了提取更有效的特征,我们通过将 DEConv 引入 RB 和 FAB 来修改块。如图7所示,在RB和FAB中,第一个香草卷积层被提出的DEConv所取代。第 3 级部署的块分别表示为 RBw/DEConv 和 FABw/DEConv。相应的模型表示为模型 RB D 和模型 FAB D。
为了公平比较,所有四个块(即 RB、FAB、RBw/DEConv 和 FABw/DEConv)在第 3 层级联 6 次,并使用相同的融合方案(即 Mixup [5])。为方便起见,我们在级别 1 和级别 2 中省略了块,并且仅将初始学习率为 2e-4 的 500K 次迭代训练模型(这些设置带有消融研究)。在相同的测试数据集上对实验结果进行了测试(即 SOTS-Indoor [38] 数据集)。尽管指标低于表V中报告的完全训练模型,趋势和值是一致的和有意义的。

所有这些上述模型的性能总结在表1中。用并行卷积层(即 DEConv)替换普通卷积层在 RB 和 FAB 上的 PSNR 方面分别提高了 0.27 和 0.6 dB。通过将模型 FAB D 与 Base FAB 进行比较,结果表明 DEConv 可以以大约两倍的参数数量(4505 K 与 2143 K)为代价绝对改进指标(即 PSNR 和 SSIM)的值。这非常不友好,在某些情况下可能会导致失败,禁止在移动或嵌入式设备上使用 DEConv。

为了解决这个问题,我们通过在相同位置(即重新参数化)中添加学习的内核权重来等效地将 DEConv 转换为标准的 3 × 3 卷积。表。II显示了重新参数化操作前后模型FAB D的参数数量(#Param.)、浮点运算次数(#FLOPs)和推理时间的比较结果。我们可以清楚地看到,重新参数化操作简化了并行结构,而不会触发性能下降。特别是,在简化之后,与 Base FAB 相比,模型 FAB D 仍然实现了 0.6 dB 的性能提升,并且没有引入额外的开销。

此外,我们还探索了并行卷积层的设计,仅从单个普通卷积层(即FAB)到两个并行香草卷积层,然后到完整的DEConv(即FABw/DEConv)。如表所示。III,在FAB中添加并行香草卷积层会导致0.15 dB的性能下降。由于同一层提取的冗余特征,这背后的根本原因可能是训练难度。相反,在 FAB 中添加并行 CDC 层可以提高性能。实验结果表明,通过嵌入传统的先验信息,差分卷积(DC)层可以有效地提取更具代表性的特征。我们还观察到,通过添加更多的并行 DC 流进行特征提取,在 PSNR 方面,性能从 33.07 dB 提高到 33.67 dB。在SSIM方面可以观察到类似的趋势。基于上述讨论,我们选择基本块FABw/DEConv的模型FAB D进行以下研究。
- CGA:此外,我们研究了所提出的两步粗到细注意机制(即 CGA)的有效性。如第 I 节所述,CGA 生成特定于通道的空间重要性图 (SIM) 来表示重要单个通道的区域。我们将CGA与其他注意机制进行比较,如许多去雾方法[5],[6],[16]中使用的特征注意模块(FAM)和常见的卷积块注意模块(CBAM)[19]。FAM 和 CBAM 都包含顺序通道注意和空间注意,实现略有不同。
模型FAB D在级别3和FABw/DEConv块内级联FABw/DEConv块,采用FAM。然后,我们将CGA和CBAM分别组合成FABw/DEConv块,分别生成FABw/DEConv和CGA(即DEAB)和FABw/DEConv和CBAM,相应的模型表示为模型DEAB和模型FAB D CBAM。
FAM 或 CBAM 中使用的空间注意力仅使用一个通道来学习 SIM,以指示输入特征的重要区域,通道数相对较大。这种方法忽略了特征的每个通道的特殊性,并以某种方式限制了 CNN 强大的表示能力。如表1的右三列所示,模型DEAB在PSNR方面优于模型FAB D和模型FAB D CBAM 1.5 dB和1.01 dB。结果表明,CGA 可以通过学习特定于通道的 SIM 来更好地重新校准特征,以关注通道级的雾霾分布差异。

图 8 直观地说明了 CGA 和 FAM 学习到的 SIM 和相应的处理结果。从图 8e 可以看出,FAM 获得的单通道 SIM 可以指示不均匀的雾霾分布(在某种程度上扩展)。然而,由于某些轮廓模式的混合,它不够准确(例如,红色椅子区域)。通过使用输入特征的内容来指导SIM的生成,CGA可以学习更准确的空间权重。图 8f 显示了 SIM 的八个随机选择的通道,以及所有 SIM 的平均图(右下)。特定于通道的 SIM 处理具有不同空间权重的不同特征通道,可以更好地引导模型专注于关键区域。图 8c 和图 8d 是相应的结果。我们观察到模型FAB D恢复的拱门区域(用红色矩形突出显示)具有明显的雾霾残留。
3)基于cga的混合融合方案:我们进一步进行消融研究,以验证所提出的基于cga的混合融合方案的有效性。我们利用AECR-Net[6]的混合融合方案的模型DEAB作为基线,然后评估另外两个方案:元素相加[10],[11],[21]和提出的基于cga的混合。他们的模型被称为模型DEAB A和模型DEAB C。比较结果如表所示。四。从这些结果中,我们看到加法与 mixup 实现了非常相似的性能(PSNR 高 0.06 dB,SSIM 降低了 0.002)。加法是具有恒定权重的混合的一种特殊情况,我们通过实验发现初始值对混合的性能有重大影响。请注意,我们提出的基于 CGA 的混合融合方案在 PSNR 和 SSIM 方面实现了最佳性能。

此外,我们在级别 1 和 2 中部署特征提取块以进一步提高性能。通过在级别 1 和级别 2 中部署残差块 (RB)(我们将此模型称为模型 MS),性能大幅提升(PSNR为2.52 dB)。这意味着即使在全分辨率空间中转换特征也可以修复丢失的信息,这对于图像回归至关重要。我们最终的DEA-Net-S在PSNR方面达到39.16 dB,在SSIM方面通过在1级和2级部署DEB。后缀“-S”表示模型采用消融研究中的设置进行训练,这是一个简化版本。对于模型 MS 和 DEA-Net-S,[N1, N2, N3, N4, N5] 设置为 [3, 3, 6, 3, 3]。值得一提的是,通过考虑模型的复杂性并避免复杂的超参数调整(例如,缩减率),我们在级别 1 和级别 2(将 DEAB 简化为 DEB)中省略了 CGA。
D. Comparisons with SOTA Methods
在本节中,我们将我们提出的DEA-Net与4种早期的去雾方法进行了比较,包括DCP[12]、DehazeNet[2]、AOD-Net[3]、GFN[23]和8种最新的最先进的(SOTA)单幅图像去雾方法,包括FFA-Net[5]、MSBDN[10]、DMT-Net[39]、AECR-Net[6]、SGIDPFF[21]、UDN[22]、PMDNet[11]、Dehamer[17]在SOTS室内、SOTS-Ourdoor、Haze4K数据集上。我们报告了三个DEA-Net变体,包括DEA-Net-S和消融研究中的设置(即表的最终模型)。IV)、正常设置的DEA-Net和AECR-Net[6]的正常设置的DEA-Net-CR和对比正则化(CR)。DEA-Net-CR与AECR-Net[6]具有相同的CR设置。请注意,CR 不会增加额外的参数和推理时间,因为它可以在测试阶段直接删除。对于其他人,我们采用这些方法的官方发布代码或评估结果进行公平比较,如果它们是公开可用的,否则我们使用相同的训练数据集重新训练它们。

定量分析。表V显示了我们的DEA-Nets和其他最先进的方法在SOTS[38]和Haze4K[39]上的定量评估结果(PSNR和SSIM指数)。我们可以看到,即使我们的DEA-Net-S在SOTS室内的PSNR和0.9921 SSIM也比替代方案取得了最好的性能。
此外,我们的DEA-Net和DEANet-CR在SOTS-室内和SOTS-室外都大大提高了性能。在 Haze4K 数据集上,我们的 DEA-Net 和 DEA-Net-CR 获得了最好的 SSIM(0.9869 和 0.9885)。我们将结果四舍五入到小数,以保持与 [39] 一致。我们的DEA-Net-CR在SOTS和Haze4K的所有比较中排名第一。此外,我们采用参数数量(#Param.)、浮点运算数(#FLOPs)和运行时间作为计算效率的主要指标。早期的去雾方法包含非常小的参数大小,但代价是性能下降很大。与最近的 SOTA 方法相比,我们的 DEA-Nets 以可接受的 # Param 运行最快。和#失败。我们的DEA-Net变体中的任何一个都可以在#Param方面排名第二。和#失败。这意味着我们的DEA-Nets可以在性能和模型复杂性之间取得良好的权衡。请注意,# FLOPs 和运行时间是在分辨率为 256 × 256 的彩色图像上测量的。

定性分析。图 9 显示了我们的 DEA-Net 和先前 SOTA 方法在合成 SOTS 室内数据集上的视觉比较。我们提出的DEA-Net可以恢复更清晰、更清晰的轮廓或边缘,DEA-Net得到的结果包含较少的雾霾残差。图 10 显示了合成 SOTSourdoor 数据集的视觉比较。我们观察到,在室外场景中,与其他替代方案相比,我们的DEA-Net的结果最接近地面真相。我们还在真实世界的模糊图像上测试了我们的DEA-Net,并将结果与各种SOTA方法进行了比较。如图所示,其他方法要么在处理后的结果上保持雾霾,要么产生颜色偏差和伪影。相反,我们的DEA-Net可以输出视觉上更令人愉悦的去雾结果。
V. CONCLUSION
在本文中,我们提出了一个DEA-Net来处理具有挑战性的单幅图像去雾问题。具体来说,我们通过引入差分卷积将局部描述符集成到正常卷积层中来设计细节增强卷积(DEConv)。与普通卷积相比,DEConv 增强了表示和泛化能力。此外,DEConv 可以等效地转换为普通卷积,而不会触发额外的参数和计算成本。然后,我们设计了一种复杂的注意机制,称为内容引导注意(CGA),该机制为每个通道分配唯一的空间重要性图(SIM)。使用 CGA,可以强调在特征中编码的更多有用信息。基于 CGA,我们进一步提出了一种融合方案,有效地将编码器部分中的低级特征与相应的高级特征融合。大量的实验表明,我们的DEA-Net在定量和定性上都取得了最先进的结果。
至此本文结束。
如果本文对你有所帮助,请点赞收藏,创作不易,感谢您的支持!
点击下方👇公众号区域,扫码关注,可免费领取一份200+即插即用模块资料!
更多推荐


所有评论(0)