【图像去雨】论文精读:Learning A Sparse Transformer Network for Effective Image Deraining
请先看【专栏介绍文章】:
前言
论文题目:Learning A Sparse Transformer Network for Effective Image Deraining —— 学习用于有效图像去雨的稀疏变压器网络
论文地址:Learning A Sparse Transformer Network for Effective Image Deraining
论文源码:https://github.com/cschenxiang/DRSformer
CVPR 2023!
文章目录
Abstract
基于Transformers的方法在图像去雨方面取得了显著的性能,因为它们可以对非局部信息进行建模,这对高质量的图像重建至关重要。在本文中,我们发现大多数现有的Transformer通常使用查询键对中的所有相似性来进行特征聚合。然而,如果查询中的标记与关键字的标记不同,则根据这些标记估计的自我关注值也会涉及特征聚合,从而干扰清晰图像的恢复。为了克服这个问题,我们提出了一种有效的训练网络——稀疏变换器(DRSformer),它可以自适应地保持最有用的自关注值进行特征聚合,从而使聚合的特征更好地促进高质量的图像重建。具体来说,我们开发了一个可学习的top-k选择算子,以自适应地保留每个查询的关键字中最关键的注意力得分,从而更好地进行特征聚合。同时,由于Transformers中的朴素前馈网络没有对潜在清晰图像恢复重要的多尺度信息进行建模,我们开发了一种有效的混合尺度前馈网络,为图像去雨生成更好的特征。为了学习一组丰富的混合特征,该特征结合了CNN算子的局部上下文,我们为模型配备了混合专家特征补偿器,以提出一种合作细化降维方案。在常用基准上的大量实验结果表明,所提出的方法与最先进的方法相比具有良好的性能。
1. Introduction
单幅图像去雨是过去十年出现的一个典型的低级视觉问题。它的目的是恢复干净的来自观察到的雨天的图像。由于清晰的图像和雨条纹是未知的,这是一个不适定逆问题。为了解决这个问题,早期的方法[20,24,60]通常根据雨纹和清晰图像的统计特性施加各种先验。事实上,这些手工制作的先验对复杂多变的雨天场景并不稳健,这限制了脱轨性能。

最近,与传统的算法相比,许多基于学习的方法 [4, 19, 23, 36, 52, 53, 56] 采用了不同的 CNN 架构作为更好的选择。然而,卷积操作的内在特征,即局部感受野和输入内容的独立性,阻碍了模型消除远程降雨退化扰动的能力。为了缓解这些限制,Transformers [2, 26, 35, 50] 已应用于图像去雨,并取得了不错的性能,因为它们可以更好地对非局部信息进行建模以进行高质量的图像重建。然而,这些方法在恢复清晰图像时,这些方法不能很好地建模图像细节,如图1所示。一个主要原因是变形金刚中的自我注意并没有对局部不变属性进行建模CNN 做得很好。由于雨条纹往往与局部区域的背景细节混淆,最近的研究[5,18,57]试图通过结合CNN操作和transformer来增强图像去雨来缓解这些缺点,其中基于标准公式的transformer。
我们注意到标准 Transformer [40] 通常使用基于查询键对的所有注意力关系来聚合特征。由于键中的标记并不总是与查询中的标记相关,因此在特征聚合中使用从这些标记估计的自注意力值会干扰以下潜在的清晰图像恢复。这一缺陷背后的根本原因在于,自我注意的原生密集计算模式放大了相对较小的相似权重,使得特征交互和聚合过程容易受到隐式噪声的影响。在建模全局特征依赖关系时,这自然会导致相应的冗余或不相关的表示[44,64]。因此,这些发现促使我们探索最有用的自注意力值,以便我们可以充分利用这些特征来更好地恢复图像恢复。
为此,我们开发了一种有效的稀疏 Transformer 网络用于图像去雨,称为 DRSformer。具体来说,所提出框架的关键组件是稀疏 Transformer 块 (STB),它包含一个 top-k 稀疏注意力 (TKSA),它保留了用于特征聚合的最有用的自注意力值和混合尺度前馈网络 (MSFN),它探索了多尺度特征以获得更好的图像去雨。首先,我们设计了top-k注意机制来代替普通的自我注意[40]。TKSA 在查询和自注意力计算的键之间保留了最大的 K 个相似度分数,从而促进了更好的特征聚合。此外,开发的 MSFN 进一步探索多尺度信息以更好地改进聚合特征。最后,基于降雨分布揭示了退化位置和程度的观察,我们还引入了专家特征补偿器(MEFC)的混合,为STB提供协同细化。通过上述设计,我们提出的方法提供了三方面的优点:(1)在对无用特征干扰的敏感性较低方面,它不仅可以丰富局部性,还可以增强全局特征利用的能力,以及(3)它可以共同探索数据(MEFC 中的体现)和内容(在 STB 中体现)稀疏性以实现去雨性能提升。
主要贡献总结如下:
- 我们提出了一种稀疏 Transformer 架构,以帮助生成具有更准确细节和纹理恢复的高质量去雨结果。
- 我们开发了一个简单而有效的可学习 top-k 选择算子来自适应地保持最有用的自注意力值以获得更好的特征聚合。
- 我们设计了一种基于混合尺度融合策略的有效前馈网络来探索多尺度表示,以更好地促进图像去雨。
- 在各种基准上的大量实验结果表明,我们的方法与最先进的 (SOTA) 方法相比取得了良好的性能。
2. Related Work
单幅图像去雨。由于图像去雨是一个不适定问题,传统方法 [12, 20, 24, 30, 60] 通常开发各种图像先验来提供额外的约束。然而,这些手工制作的先验往往依赖于经验观察,因此无法对清晰图像的固有属性进行建模。为了克服这个问题,已经开发了许多基于 CNN 的框架 [53] 来解决图像去雨并实现不错的恢复性能。为了更好地表示降雨分布,一些研究考虑了降雨方向[27]、密度[61]、遮蔽效应[15]等降雨特征,并通过递归计算[19,23,36]或传递机制[16,49,54,55]优化网络结构。尽管这些方法比手工制作的基于先验的方法取得了更好的性能,但由于卷积的内在限制,它们难以捕获长期依赖关系。不同的基于 CNN 的去雨方法,我们利用 Transformer 作为网络主干来建模非局部信息以进行图像去雨。
视觉Transformers。受 Transformer [7] 在自然语言处理 (NLP) [40] 和高级视觉任务 [1, 28] 中的巨大成功的启发,Transformers 已应用于图像恢复 [2, 13, 48, 51, 58],并且比以前的基于 CNN 的基线表现更好,因为它们能够对非本地信息进行建模。对于图像雨去除领域,Jiang等人[18]通过将Transformer中的自我注意与背景恢复网络相结合,设计了一个动态相关的脱轨网络。最近,肖等人。 [50] 使用基于窗口的和基于空间的对偶 Transformer 精心开发了图像去雨 Transformer (IDT),以实现出色的结果。请注意,大多数现有方法依赖于密集的点积自注意力作为 Transformer 的核心。然而,这种计算方式的一个缺点是权重较小的冗余或不相关的特征可能会干扰注意力图,这使得输出特征包含潜在的噪声。在这项工作中,我们在 Transformer 中提出了稀疏注意力,以减轻 vanilla self-attention 面临的最相关信息的疏忽。
稀疏表示。从生物大脑中神经活动中汲取灵感,深度神经网络中隐藏表示的稀疏性作为视觉和 NLP 任务的诱人“免费午餐”出现 [44, 64]。事实上,人们普遍认为稀疏表示在处理低级视觉问题方面也起着至关重要的作用,例如图像去雨和超分辨率[31]。原则上,稀疏注意力可以分为基于数据的(固定)稀疏注意力和基于内容的稀疏注意力 [6, 38]。对于基于数据的稀疏注意力,CNN 主干中引入了几个局部注意力操作,主要只考虑关注局部窗口大小。最近的研究 [11, 42] 研究了对 Transformer 主干实施稀疏性。最近,张等人。 [63] 设计了一个注意力可收回的 Transformer,以允许稀疏区域的标记交互特征,这是基于数据的稀疏性。与之不同的是,我们实现了一种简单而有效的基于top-k选择的自我注意近似,以实现稀疏注意,这是基于内容的稀疏性。
Top-k 选择。Zhao等人[64]首先提出了一种基于NLP任务中top-k机制的显式选择方法。在他们的成功的推动下,进一步引入了 k-NN 注意力 [42, 44] 来增强视觉Transformer。与在空间维度[44]中执行top-k选择不同,我们设计了一个高效的top-k有用通道选择算子。
3. Proposed Method
在本节中,我们首先描述用于图像去雨的整体管道和对称分层网络架构。之后,我们提供了所提出的稀疏 Transformer 块 (STB) 的细节,作为我们方法的基本构建块,它主要包含两个关键元素:top-k 稀疏注意力 (TKSA) 和混合尺度前馈网络 (MSFN)。最后,我们介绍了引入的专家特征补偿器 (MEFC) 混合。
3.1. Overall pipeline

我们提出的 DRSformer 的整体管道,如图 2 所示,基于分层编码器-解码器框架。给定一个雨天图像Irain∈RH×W ×3,其中H × W表示特征图的空间分辨率,我们使用3 × 3卷积进行重叠图像补丁嵌入。在网络主干中,我们堆叠 Ni∈[1,1,2,3,4]STB 以提取丰富的特征,用于空间变化的降雨分布。为了从降雨退化中挖掘多尺度表示,每个级别的编码器-解码器管道都涵盖了它自己的特定空间分辨率和通道维度。对于特征下采样和上采样,我们应用像素-unshuffle和像素-shuffle操作。与 [48,50,58] 类似,我们还添加了跳跃连接来桥接连续中间特征以进行稳定训练。在每个 STB 中,与 Transformer 中的标准自注意力 [7] 不同,我们开发了 TKSA 来实现特征稀疏性,旨在更有效地强制特征聚合过程。此外,在STB中引入了MSFN来丰富多尺度局部信息,帮助图像恢复。在模型学习的早期阶段和最终阶段,我们为我们的模型配备了 N0 MEFC 以提供互补的特征细化,从而可以最终重建高质量的清晰输出。通过这种混合公式,我们允许DRSformer同时利用雨天图像的自适应内容和内在属性,促进不希望的雨条纹和潜在清晰的背景的分离,实验表明上述设计选择产生了质量改进(见第4.3节)。
最终重建结果由:Iderain =F(Irain) + Irain得到,其中F(·)为整体网络,通过最小化以下损失函数进行训练:
L
=
∥
I
derain
−
I
g
t
∥
1
,
(1)
\mathcal{L}=\left\|I_{\text {derain }}-I_{g t}\right\|_{1},\tag{1}
L=∥Iderain −Igt∥1,(1)
其中 Igt 表示真实图像,‖·‖1 表示 L1 范数。
3.2. Sparse Transformer block
由于标准 Transformer [7, 40, 58] 采用所有标记来全局计算自注意力,这对于图像恢复来说并不友好,因为它可能涉及不相关特征之间的噪声交互。为了解决这些限制,我们利用神经网络中出现的稀疏性的优势,开发了一个稀疏变压器块(STB)作为特征提取单元[64]。形式上,给定第(l-1)块Xl−1处的输入特征,STB的编码过程可以定义为:
X
l
′
=
X
l
−
1
+
TKSA
(
LN
(
X
l
−
1
)
)
,
X
l
=
X
l
′
+
MSFN
(
LN
(
X
l
′
)
)
,
(2-3)
\begin{array}{c} \mathbf{X}_{l}^{\prime}=\mathbf{X}_{l-1}+\operatorname{TKSA}\left(\operatorname{LN}\left(\mathbf{X}_{l-1}\right)\right), \\ \mathbf{X}_{l}=\mathbf{X}_{l}^{\prime}+\operatorname{MSFN}\left(\operatorname{LN}\left(\mathbf{X}_{l}^{\prime}\right)\right), \end{array}\tag{2-3}
Xl′=Xl−1+TKSA(LN(Xl−1)),Xl=Xl′+MSFN(LN(Xl′)),(2-3)
其中LN表示层归一化;X 'l和Xl表示top-k稀疏注意(TKSA)和混合尺度前馈网络(MSFN)的输出,如下所述。
Top-k 稀疏注意力 (TKSA)。我们重新审视 Transformer 中的标准自注意力,这已成为大多数现有模型中的经验操作。给定一个维度为 RL×d 的查询 Q、键 K 和值 V,点积注意力的输出通常表示为:
Att
(
Q
,
K
,
V
)
=
softmax
(
Q
K
⊤
λ
)
V
(4)
\operatorname{Att}(\mathbf{Q}, \mathbf{K}, \mathbf{V})=\operatorname{softmax}\left(\frac{\mathbf{Q} \mathbf{K}^{\top}}{\lambda}\right) \mathbf{V}\tag{4}
Att(Q,K,V)=softmax(λQK⊤)V(4)
其中 Q、K 和 V 分别表示 Q、K 和 V 的矩阵形式。λ 是由 λ = √d 定义的可选温度因子。通常,多头注意力是针对 k 个新 Q、K 和 V 中的每一个实现的,产生 d = C/k 通道维输出,这些输出被连接起来,然后通过线性投影得到所有头的最终结果。请注意,这种普通的自注意力范式基于密集连接,这需要计算所有查询键对的注意力图。在我们的工作中,我们开发了 TKSA 来替换它,从而避免在特征交互过程中不相关信息的参与。
具体来说,我们首先通过应用 1×1 卷积和 3×3 深度卷积来编码通道上下文。受[58]的启发,我们在通道而不是空间维度上应用自我注意来降低时间和内存的复杂性。接下来,我们计算所有重塑查询和键之间的像素对的相似性,并屏蔽掉在大小为RˆC׈C的转置注意矩阵M中赋予较低注意权重的不必要的元素。与随机丢弃分数的 dropout 策略不同,在 M 上实现了前 k 个贡献分数的自适应选择,旨在保留最重要的组件并删除无用的组件 [3]。这里,k 是一个可调参数,用于动态控制稀疏度的大小,它是通过一些适当分数的加权平均值正式获得的,例如 2 3。因此,只有范围 [Δ1, Δ2] 中的 top-k 值从 M 的每一行进行归一化以进行 softmax 计算。对于其他小于 top-k 分数的元素,我们使用散点函数在给定的索引处用 0 替换它们的概率。这种动态选择使得注意力从密集到稀疏,其推导公式为:
SparseAtt
(
Q
,
K
,
V
)
=
softmax
(
T
k
(
Q
K
⊤
λ
)
)
V
(5)
\operatorname{SparseAtt}(\mathbf{Q}, \mathbf{K}, \mathbf{V})=\operatorname{softmax}\left(\mathcal{T}_{k}\left(\frac{\mathbf{Q} \mathbf{K}^{\top}}{\lambda}\right)\right) \mathbf{V}\tag{5}
SparseAtt(Q,K,V)=softmax(Tk(λQK⊤))V(5)
其中 Tk(·) 是可学习的 top-k 选择算子:
[
T
k
(
S
)
]
i
j
=
{
S
i
j
S
i
j
∈
top-k
(
row
j
)
0
otherwise
(6)
\left[\mathcal{T}_{k}(\boldsymbol{S})\right]_{i j}=\left\{\begin{array}{ll} S_{i j} & S_{i j} \in \text { top-k }(\text { row } j) \\ 0 & \text { otherwise } \end{array}\right.\tag{6}
[Tk(S)]ij={Sij0Sij∈ top-k ( row j) otherwise (6)
最后,我们将 softmax 和值乘以矩阵乘法。由于我们使用多头策略,我们连接多头注意力的所有输出,然后通过线性投影得到最终的结果。
混合尺度前馈网络(MSFN)。以往的研究[48,50,58]通常将单尺度深度卷积引入到常规的前馈网络中,以提高局部性。然而,这些利用都忽略了多尺度雨纹的相关性。事实上,丰富的多尺度表示已经充分证明了它在更好地去除雨方面的有效性[19,41]。在这里,我们通过在传输过程中插入两个多尺度深度卷积路径来设计MSFN,如图2所示。给定一个输入张量Xl−1∈RH×W ×C,经过层归一化后,我们首先利用1×1卷积以r的比例扩展通道维度,然后将其送入两个并行分支。在特征变换过程中,采用3×3和5×5深度卷积来增强多尺度局部信息提取。这样,所开发的MSFN的整个特征融合过程公式为:
X
^
l
=
f
1
×
1
c
(
LN
(
X
l
−
1
)
)
,
X
l
p
1
=
σ
(
f
3
×
3
d
w
c
(
X
^
l
)
)
,
X
l
s
1
=
σ
(
f
5
×
5
d
w
c
(
X
^
l
)
)
,
X
l
p
2
=
σ
(
f
3
×
3
d
w
c
[
X
l
p
1
,
X
l
s
1
]
)
,
X
l
s
2
=
σ
(
f
5
×
5
d
w
c
[
X
l
s
1
,
X
l
p
1
]
)
,
X
l
=
f
1
×
1
c
[
X
l
p
2
,
X
l
s
2
]
+
X
l
−
1
,
(7)
\begin{array}{l} \hat{\mathbf{X}}_{l}=f_{1 \times 1}^{c}\left(\operatorname{LN}\left(\mathbf{X}_{l-1}\right)\right), \\ \mathbf{X}_{l}^{p_{1}}=\sigma\left(f_{3 \times 3}^{d w c}\left(\hat{\mathbf{X}}_{l}\right)\right), \mathbf{X}_{l}^{s_{1}}=\sigma\left(f_{5 \times 5}^{d w c}\left(\hat{\mathbf{X}}_{l}\right)\right), \\ \mathbf{X}_{l}^{p_{2}}=\sigma\left(f_{3 \times 3}^{d w c}\left[\mathbf{X}_{l}^{p_{1}}, \mathbf{X}_{l}^{s_{1}}\right]\right), \mathbf{X}_{l}^{s_{2}}=\sigma\left(f_{5 \times 5}^{d w c}\left[\mathbf{X}_{l}^{s_{1}}, \mathbf{X}_{l}^{p_{1}}\right]\right), \\ \mathbf{X}_{l}=f_{1 \times 1}^{c}\left[\mathbf{X}_{l}^{p_{2}}, \mathbf{X}_{l}^{s_{2}}\right]+\mathbf{X}_{l-1}, \end{array}\tag{7}
X^l=f1×1c(LN(Xl−1)),Xlp1=σ(f3×3dwc(X^l)),Xls1=σ(f5×5dwc(X^l)),Xlp2=σ(f3×3dwc[Xlp1,Xls1]),Xls2=σ(f5×5dwc[Xls1,Xlp1]),Xl=f1×1c[Xlp2,Xls2]+Xl−1,(7)
其中 σ(·) 是 ReLU 激活,fc1×1 表示 1×1 卷积,f dwc3×3 和 f dwc5×5 表示 3×3 和 5 × 5 深度卷积,[·] 是通道级联。
3.3. Mixture of experts feature compensator
为了填补 DRSformer 中整合稀疏性的综合教师,我们进一步引入 MEFC 对联合数据和内容稀疏性进行统一的共同探索。回想一下有效 CNN 模型 [39] 的经典设计,我们精心选择了多个稀疏 CNN 操作来形成并行层,称为专家,涉及感受野为 3 × 3 的平均池化,内核大小为 1 × 1,3 × 3、5×5、7 × 7 的可分离卷积层和扩张卷积层与3 × 3、5 × 5、7 × 7的内核大小。与传统的专家混合[17,37]不同,我们的MEFC不附加外部门控网络。相反,我们让 self-attention [14,21] 成为不同专家的切换器,根据输入自适应地选择不同表示的重要性。给定一个输入特征图 Xl−1 ∈ RH×W ×C ,我们首先应用通道平均来生成 C 维通道描述符 zc ∈ RC :
z
c
=
1
H
×
W
∑
i
=
1
H
∑
j
=
1
W
X
l
−
1
(
i
,
j
)
,
(8)
\mathbf{z}_{c}=\frac{1}{H \times W} \sum_{i=1}^{H} \sum_{j=1}^{W} \mathbf{X}_{l-1}(i, j),\tag{8}
zc=H×W1i=1∑Hj=1∑WXl−1(i,j),(8)
其中 Xl−1(i, j) 是特征 Xl−1 的 (y, x) 位置。然后,将每个专家的系数向量分配给可学习的权重矩阵 W1 ∈ RT ×C 和 W2 ∈ RO×T。这里,T 是权重矩阵的维度。为了避免改变其输入和输出的大小,我们零填充每个专家计算的输入特征图。最后,第 l 个 MEFC 的输出由下式计算:
T
l
=
W
2
σ
(
W
1
z
c
)
X
l
=
f
1
×
1
c
[
∑
i
=
1
O
f
exp
(
X
l
,
T
l
)
]
+
X
l
−
1
(9)
\begin{array}{l} \mathbf{T}_{l}=\mathbf{W}_{2} \sigma\left(\mathbf{W}_{1} \mathbf{z}_{c}\right) \\ \mathbf{X}_{l}=f_{1 \times 1}^{c}\left[\sum_{i=1}^{O} f_{\exp }\left(\mathbf{X}_{l}, \mathbf{T}_{l}\right)\right]+\mathbf{X}_{l-1} \end{array}\tag{9}
Tl=W2σ(W1zc)Xl=f1×1c[∑i=1Ofexp(Xl,Tl)]+Xl−1(9)
其中 fexp 和 O 分别表示专家操作和专家数量。f c1×1 表示 1 × 1 卷积,σ(·) 是 ReLU 函数,[·] 是通道连接。通过这种设计,MEFC现在与主要的STB密切相关,从而能够自适应地去除不同外观的下雨效果。
4. Experiments and Analysis
4.1. Experimental settings
数据集。我们在多个公共基准上实现了脱轨实验,包括Rain200L/H[52]、DID-Data[61]和DDN-Data[8]。Rain200L 和 Rain200H 包含 1,800 张用于训练的合成雨图像和 200 张用于测试的合成雨图像。DID-Data 和 DDN-Data 由 12,000 和 12,600 张具有不同雨方向和密度级别的合成图像组成。有 1,200 和 1,400 张雨天图像进行测试。此外,我们还使用大规模数据集(即 SPA-Data [45])来评估我们的方法,该数据集包含 638,492 个用于训练的图像对和 1,000 个测试图像对。
比较方法。我们将我们的 DRSformer 与两个基于先验的模型(DSC [30] 和 GMM [24])、基于 CNN 的方法(DDN [8]、RESCAN [23]、PReNet [36]、MSPFN [19]、RCDNet [43]、MPRNet [59]、DualGCN [9] 和 SPDNet [56])以及最近的基于 Transformer 的方法(Uformer [48]、Restormer [58] 和 IDT [50])。对于最近的代表性方法(DualGCN、SPDNet、Restormer 和 IDT),如果没有提供预训练模型,我们会重新训练作者提供的模型,否则我们使用他们的在线代码对它们进行评估以进行公平比较。对于其他方法,我们参考 [10, 50] 中一些报告的结果。
评估指标。我们采用 PSNR [34] 和 SSIM [47] 作为上述基准的评估指标。继之前的去雨方法 [10,19] 之后,我们计算 YCbCr 空间的 Y 通道中的 PSNR 和 SSIM 指标。对于没有地面真实图像的雨天图像,我们使用NIQE[33]和BRISQUE[32]等非参考指标。
训练细节。在我们的模型中,{N0, N1, N2, N3, N4} 设置为 {4, 4, 6, 6, 8},相同级别四个 STB 的注意力头数设置为 {1, 2, 4, 8}。初始通道C为48,扩展比设置为2。在MEFC方面,我们设置专家数量O = 8,权重矩阵为T = 32。请注意,我们不使用 MEFC 来训练 Rain200L 和 SPA-Data,因为它们的雨纹不太复杂,更容易学习。在 STB 方面,TKSA 中的稀疏度 [Δ1, Δ2] 设置为 [1, 2 , 4 5],MSFN 中的通道扩展因子 r 设置为 2.66。在训练期间,我们使用批量大小为 8 的 AdamW 优化器,补丁大小为 128,总共 300K 次迭代。92K 次迭代的初始学习率固定为 1×10−4,然后使用余弦退火方案 [29] 在 208K 迭代中降低到 1 × 10−6。对于数据增强,随机应用垂直和水平翻转。整个框架使用 4 个 NVIDIA GeForce RTX 3090 GPU 在 PyTorch 上执行,它以端到端学习方式工作,而无需昂贵的大规模预训练 [2]。
4.2. Comparisons with the state-of-the-arts
合成数据集。表1报告了对不同基准数据集的定量评估。如图所示,我们注意到我们提出的方法优于所有其他去噪器,特别是在PSNR上,例如,DRSformer平均超过了并发方法IDT 0.4 dB。与之前的基于 CNN 的模型相比,这一进展更加明显。DID-Data 和 DDN-Data 基准测试的显着增加分数表明我们的方法可以正确处理不同类型的空间变化的雨条纹。为了令人信服的证据,我们在图 3 中展示了最近方法生成的样本之间的视觉质量比较。纯基于 CNN 的模型,例如 MPRNet 和 SPDNet,无法在繁重的雨天场景中恢复清晰的图像。可以看出,所有基于 Transformer 的方法的结果在细节和纹理恢复方面都存在缺陷。不幸的是,IDT 甚至引入了相当大的边界伪影。由于开发的具有top-k选择的稀疏注意,我们的方法可以生成高质量的去雨结果,这与ground truth更加一致。



真实世界的数据集。我们进一步对 SPA-Data 基准数据集进行了实验,相应的结果如表 1 的最后一列所示。正如预期的那样,我们的模型继续达到最高的 PSNR/SSIM 值,在去雨性能和泛化方面表现出 DRSformer 的优越性。视觉质量比较可以在图4中观察到。相比之下,我们的方法在去除大多数雨纹的同时显著与其他雨纹竞争,同时保留了真实的图像结构。为了进一步验证 DRSformer 的有效性,我们还从 Internet-Data [45] 中随机选择 20 张没有基本事实的真实雨天图像来执行另一个评估。如表 2 所示,我们的网络获得了较低的 NIQE 和 BRISQUE 值,这意味着在真实雨天场景中,与其他比较模型相比,具有更清晰的内容和更好的感知质量的高质量输出。通过图5中的定性比较,大多数深度模型对空间长雨条纹敏感,留下一些明显的降雨效应。相反,我们的网络成功地去除了大多数降雨扰动,并拥有视觉上令人愉悦的恢复效果,这意味着它可以很好地推广到看不见的现实世界数据类型。
4.3. Ablation studies

Top-k 选择的有效性。为了检验top-k选择在TKSA中的作用,我们在图6中展示了TKSA w/o top-k的脱轨结果。我们可以看到,不使用top-k选择的方法去噪图像的PSNR值低于使用top-k选择的方法的PSNR值。此外,我们还注意到式(4)中自注意矩阵softmax(QK>λ)的每个元素是非负的,softmax(QK>λ)每一行的元素之和为1。因此,应用自注意力矩阵 softmax(QK>λ) 到 V 将去除 V 的高频信息,从而导致过度平滑的结果。

为了了解这种top-k选择的效果,我们进一步使用高通滤波器(HPF)来可视化图8中的学习特征。与标准的自我注意操作(w/o top-k)相比,我们的策略可以更好地帮助重建更精细的细节特征,提高潜在的恢复质量。由于附近的像素往往比其他像素更相似,top-k 选择算子有助于从远程像素依赖中减少不相关的上下文。这种选择步骤允许在自注意力计算过程中丢弃较小的相似性权重(来自远程特征交互的一部分),从而促进更准确的表示以实现高质量的输出。

k 数量的影响。我们提出的 TKSA 的关键参数为 k,其影响如图 7 所示。我们注意到 k 的最佳选择决定了稀疏率的边界控制。如果 k 手动设置为单个值,例如 1 2 ,我们注意到其性能对 k 很敏感。为了避免穷举搜索,我们为 k 设置了一个可控的区间范围来动态学习贡献最大的分数。当 k 太小时,我们发现由于全局信息聚合不足,性能无疑会急剧下降。当 TKSA 中的 [Δ1, Δ2] 分配给 [1, 2 , 4 5] 时,最佳结果可以达到 32.18 dB。随着 k 继续增加,由于引入了不相关和无用的特征,最终去雨性能逐渐降低。

MSFN的有效性。为了评估所提出的MSFN的有效性,我们将其与三个基线进行比较:(1)传统的前馈网络(FN)[7]、(2)Dconv前馈网络(DFN)[25]和(3)门控dconv前馈网络(GDFN)[58]。Rain200H的定量分析结果如表3所示。虽然GDFN在两个相同尺度的深度卷积流中引入了门控机制,带来了性能优势,但它仍然忽略了多尺度知识进行脱除。通过在不同尺度的局部特征提取和融合的基础上,MSFN确实可以更好的性能,在GDFN上实现了0.21 dB的PSNR增益。

MEFC的有效性。为了评估MEFC的有效性,我们基于表4中的不同模型变体进行了实验。与基线模型(a)相比,由于辅助数据的稀疏性,MEFC提供了额外的性能优势。此外,我们观察到MEFCs在网络管道的不同位置对恢复性能有特定的影响。事实上,我们还分析了每个MEFC中不同专家数量的影响。当使用单个专家模型 (d) 时,与我们的多专家模型 (f) 相比,性能显着下降。与将所有专家设置为相同的结构 [21] 不同,我们的多专家公式更加多样化,由于感受野不同和 CNN 操作不同,这给性能带来了收益。通过图 9 中的放大框,具有上述所有组件的模型的恢复结果往往更清晰,因为它可以在恢复过程中充分利用更多样化的特征。总而言之,我们的模型 (f) 的性能优于其他可能的配置,这表明我们考虑的每个设计策略都对 DRSformer 最终性能有自己的贡献。
4.4. Closely-related methods
我们注意到,最近的方法[22]提出了一种k-NN图像转换器(KiT),通过将k个相似的补丁与成对局部注意聚合来解决图像恢复问题。与不使用复杂位置敏感散列的 KiT 相比,我们简单但有效的 top-k 选择机制不仅享有局部性,而且还赋予了全局关系挖掘的能力。由于 KiT 的代码不可用,我们参考他们论文的结果。图 10 显示了在 Rain800 [62] 上训练的定性比较。我们可以看到 KiT 倾向于模糊内容并导致颜色失真。相比之下,我们的方法会导致更好的去雨结果。

此外,我们还注意到[44]最近设计了kNN注意,通过选择top-k相似的标记来增强视觉变形器的表示能力。与实现top-k选择的KVT[44]不同在空间维度上,我们的算子在计算跨通道的稀疏注意力方面更有效。此外,我们提出的 TKSA 中 k 的稀疏级别是动态可学习的,而不是 [44] 中的固定设置。在这里,我们在 KVT 中采用 k-NN attention 来替换我们的 TKSA 进行比较。为了确保公平比较,保持相同的训练设置用于模型测试。如图 10 © 和 (d) 所示,我们的方法可以生成更清晰的图像。
5. Concluding Remarks
我们提出了一种有效的稀疏变压器网络DRSformer来解决图像去雨问题。基于观察到 Transformer 中的 vanilla self-attention 可能会受到不相关信息的全局交互的影响,我们开发了 top-k 稀疏注意力来保持最有用的 self-attention 值以获得更好的特征聚合。为了促进去除雨的聚合特征,我们开发了一个混合尺度的前馈网络来更好地探索多尺度表示。此外,将专家特征补偿器的混合引入到模型中,为稀疏Transformer主干提供协同细化,从而保留了重建图像的精细细节。实验结果表明,我们的 DRSformer 优于最先进的方法。
限制。我们提出的方法旨在进一步提高图像去雨性能,但在模型效率方面存在局限性。具体来说,我们的模型需要一个33.7万个参数,在一个大小为256×256的图像上花费242.9G FLOPs。我们将在我们的模型中应用修剪或蒸馏方案来保持原始的脱轨性能,同时实现可信的模型压缩。
至此本文结束。
如果本文对你有所帮助,请点赞收藏,创作不易,感谢您的支持!
点击下方👇公众号区域,扫码关注,可免费领取一份200+即插即用模块资料!
更多推荐


所有评论(0)