请先看【专栏介绍文章】:


前言

论文题目:Cross Paradigm Representation and Alignment Transformer for Image Deraining —— 用于图像去雨的交叉范式表示和对齐转换器

论文地址:Cross Paradigm Representation and Alignment Transformer for Image Deraining

论文源码:https://github.com/zs1314/CPRAformer

ACM MM 2025!



Abstract

基于 Transformer 的网络通过利用空间或通道自注意力在图像去雨等低级视觉任务中取得了强大的性能。然而,不规则的降雨模式和复杂的几何重叠挑战了单范式架构,需要一个统一的框架来整合互补的全局和局部和空间通道表示。为了解决这个问题,我们提出了一种新颖的交叉范式表示和对齐转换器(CPRAformer)。它的核心思想是分层表示和对齐,利用这两种范式(空间通道和全局局部)的优势来帮助图像重建。它弥合了范式内部和范式之间的差距,对齐和协调它们以实现特征的深度交互和融合。具体来说,我们在 Transformer 块中使用两种类型的自注意力:稀疏提示通道自注意力 (SPCSA) 和空间像素细化自注意力 (SPR-SA)SPC-SA 通过动态稀疏性增强了全局通道依赖关系,而 SPR-SA 侧重于空间降雨分布和细粒度纹理恢复。为了解决它们之间的特征错位和知识差异,我们引入了自适应对齐频率模块(AAFM),它以两阶段渐进的方式与特征对齐和交互,从而实现自适应引导和互补性。这减少了范式内部和范式之间的信息差距。通过这种统一的跨范式动态交互框架,我们从两种范式中提取最有价值的交互融合信息。大量的实验表明,我们的模型在8个基准数据集上达到了最先进的性能,进一步验证了CPRAformer在其他图像恢复任务和下游应用中的鲁棒性。

1 Introduction

单幅图像去噪(SID)是一种传统的低级视觉任务,旨在从给定的雨天图像恢复清晰、高质量的图像。由于它在视频监控、自动驾驶和医学成像等各个领域的下游任务中起着至关重要的作用,越来越受到学术界和工业界的关注。由于其不适定的性质,早期的方法通常基于雨条纹和干净图像统计特征应用各种先验[32,74]。然而,在复杂多样的雨天场景中,这样的先验并不总是成立的。

最近,许多研究提出了基于卷积神经网络(CNN)的方法来应对这一挑战[25,30,31,45,68,72]。然而,由于卷积算子的接受域有限,阻碍了远程空间建模,这限制了模型的性能。幸运的是,受变形金刚在自然语言处理和高级视觉任务方面的成功[17,51,53,60]的启发,研究人员为SID任务开发了基于变压器的架构[6,52,61]。利用自注意力机制,基于 Transformer 的方法可以建立全局依赖关系,减轻基于 CNN 的方法的局限性并表现出卓越的去雨性能。认识到变形金刚的潜力,一些研究人员从不同的角度探索了它们在SID任务中的有效应用。在空间建模方面,一些方法使用非重叠的空间窗口来捕获更多的全局依赖关系,增强空间像素建模[61]。关于通道,已经提出了“转置”注意力[71],其中自注意力沿通道维度而不是空间维度计算。这些方法在各自的维度上具有很强的特征提取和建模能力,取得了显著的效果。直观地说,提取空间特征和捕获通道上下文信息在增强图像恢复中的 Transformer 性能方面发挥着重要作用 [10]。此外,由于雨纹和无雨背景的复杂交织,全局和局部特征对于具有挑战性的SID任务都是必不可少的。然而,Transformers 中的自注意力机制没有充分利用 CNN 的局部不变性。为了解决这个问题,一些研究人员试图将 CNN 与 Transformer [6 , 8] 相结合,继承了 CNN 在局部建模和 Transformer 在捕获远程依赖方面的优势。

在这里插入图片描述

然而,自然会出现两个关键问题:(1)我们如何同时利用所有范式的信息。如图 1 所示,来自不同视角的表示无疑在 SID 任务性能中起着至关重要的作用; (2) 我们如何有效地对齐和聚合每个范式中的两个特征类型。跨范式的不同特征模型做出简单的求和或连接容易出现信息丢失,未能显着提高性能。为了解决这些问题,我们提出了一种新颖的混合架构:交叉范式表示和对齐转换器(CPRAformer)。它的核心思想是通过维度一致性(空间通道视角)和多视角集成(全局-局部视角)建立跨范式表示学习框架,以及每个范式中相应特征的对齐和分层融合。具体来说,它由两个精心设计的组件组成:Cross-Paradigm Interaction 和 Alignment Self-Attention (CPIA-SA) 和多尺度流门控网络 (MSGN)。

在 CPIA-SA 中,我们引入了两种类型的自注意力:稀疏提示通道自注意力(SPC-SA)和空间像素细化自注意力(SPR-SA)。SPC-SA 沿通道维度计算注意力,并使用提示信息动态过滤密集注意力集中的注意力值。这允许网络利用稀疏性,保留最有价值的注意信息,同时最小化可能会降低图像恢复质量的过度噪声交互,从而有效地提取全局通道信息。相反,SPR-SA 利用一种高效的基于 CNN 的架构来近似自注意力,从而能够有效地利用局部细粒度特征和相邻空间像素之间的关系进行有效的建模。此外,这两种自注意力机制是互补的。SPC-SA 为 SPR-SA 提供了特征之间的全局信息,从而扩大了像素的感受野。同时,SPR-SA增强了每个特征图的空间表示,有助于对通道上下文进行建模。

同时,为了进一步促进每个范式内的对齐和交互,我们提出了一种两阶段渐进融合策略,称为自适应对齐频率模块 (AAFM)。利用自适应加权,对齐相应的分支,增强频谱之间的相互作用,聚合和加强内部特征信息。此外,Transformer 模块的另一个关键组件是前馈网络 (FFN) [17],它通常通过全连接层提取特征,但通常忽略了 SID 任务所需的关键多尺度信息 [1, 6]。为了解决这个限制,我们引入了多尺度流门控网络 (MSGN)。利用门控机制,MSGN 结合了多尺度表示学习,为 FFN 提供额外的非线性信息并提高其捕获基本特征的能力。

总之,通过上述设计,我们的CPRAformer实现了跨范式特征模式学习和信息对齐,从而实现鲁棒的特征表示。我们的主要贡献总结如下:

  • 我们为 SID、CPRAformer 提出了一种混合模型,该模型集成了空间通道和全局局部范式的优点。通过跨范式动态交互,它对齐和自适应融合两种范式之间的特征模式。
  • 我们利用SPC-SA和SPR-SA在空间和通道维度上提取特征,有效地建模全局依赖关系,同时捕获局部细节进行互补特征集成。
  • 为了弥补范式之间的特征差距,我们开发了AAFM,首先通过自适应加权进行特征对齐,然后通过频域交互实现特征融合。这有助于不同类型信息之间的更好的协调和深度交互。此外,还包括 MSGN 来学习尺度感知空间特征。

2 Related works

2.1 Single Image Deraining

传统的降雨去除方法通常依赖于手工制作的先验[22,28,32,40,74],这些先验是主观的,无法适应复杂的降雨场景。为了解决这个问题,许多研究人员开发了基于 CNN 的方法 [25、30、31、45、55、67、68、70、72 ] 进行图像去雨,取得了可喜的结果。然而,卷积很难在空间和通道维度上捕获长期依赖关系。受变形金刚在高级视觉任务方面的成功[17,51,53,60]的启发,它们也被应用于图像去雨[6,35,44,52,54,57,60,61,63]。Transformer 作为一个新的网络主干,由于其出色的全局上下文感知能力,显示出对基于 CNN 的方法的显着改进。然而,self-attention 的一个限制是注意力值低或不相关标记的标记会干扰密集注意力矩阵,潜在地损害输出特征 [6, 49, 65]。如图3所示,为了克服这一点,我们提出了一种自适应稀疏注意机制,该机制使用可学习算子动态调整稀疏范围。这种方法最大化了网络稀疏性,减少了朴素自我注意中不相关噪声的过度干扰。

在这里插入图片描述

2.2 Feature Aggregation

全局和局部。为了利用 CNN 在全局建模中提取局部特征和 Transformer 方面的优势,已经提出了许多混合模型。例如,ELF[23]是第一个将基于关联学习将这些体系结构统一为轻量级脱轨模型的人。受渐进式学习的启发,HCT-FFN[8]引入了一种新的阶段混合去雨网络。SIFANet[78]使用自适应特征聚合来协同局部特征和非局部特征交互。Dual-former [5] 将自注意力的全局建模能力与统一架构中卷积的局部能力相结合。它使用混合 Transformer 块来模拟远程空间依赖性并处理不均匀的通道分布。

空间和通道。在 CNN 中,研究人员沿空间和通道维度应用注意力机制来增强特征表示,如 RESCAN [31]、MSPFN [25] 和 MPRNet [72] 等模型所示。在基于 Transformer 的方法中,空间自注意力主要用于捕获像素之间的长期依赖关系;例如,IDT[64] 使用具有窗口和空间注意力的双重 Transformer 进行去雨。此外,一些研究将 Transformer 中的通道自注意力集成到 Transformer 中,以结合空间和通道信息。值得注意的是,Restormer [71] 通过沿通道维度估计自注意力来设计高效的 Transformer 模型,实现了显着的性能提升,而 DRSFormer [6] 沿通道维度提出了一个稀疏 Transformer,以充分利用信息量最大的特征进行去雨。DAT [10] 在跨连续 Transformer 块的空间和通道自注意力机制之间交替,从块内和块内的空间和通道维度聚合特征。

动机。对全局局部和空间通道这两种范式的广泛研究证明了特征表示在复杂降雨场景中的关键作用。然而,没有研究同时考虑这两种范式(见图 1)。因此,我们在图像去雨中引入了两种类型的自注意力机制,用于全面的信息探索和表示。此外,我们设计了 AAFM 来动态实现范式间和范式内特征聚合,迭代地细化跨尺度和维度的特征连贯性。

3 Method

3.1 Overall Pipeline

我们提出的CPRAformer的总体流程如图2所示,它采用具有跳跃式连接的编码器-解码器架构。具体来说,给定一个输入雨图像“雨”∈“雨×雨×3”,我们首先应用7 × 7卷积得到低级特征嵌入“丢脸0∈”和“丢脸”,分别为高、宽、通道。然后将低级特征嵌入输入骨干网络,该网络由 4 级编码器-解码器结构组成。在编码器阶段,高分辨率输入的分辨率在增加通道数的同时减少了 2 倍,而在解码器阶段,该过程是相反的。每个编码器和解码器由 ¢ (푡 = 1, 2, 3, 4) 堆叠的 Cross 范式表示和对齐 Transformer Block (CPRAformerB) 组成。在每个CPRAformerB中,我们开发了CPIA-SA,可以同时从空间通道和全局局部范式中提取特征。此外,我们在每个CPRAformerB中加入MSGN,它利用优雅的门控机制来提取多尺度信息,帮助图像去雨过程。

在这里插入图片描述

如图 2 所示,CPIA-SA 由三个主要组件组成:稀疏提示通道自注意力(SPC-SA)、空间像素细化自注意力(SPR-SA)和频率自适应交互模块(AAFM)。SPC-SA 使用高效提示引导算子 (EPGO) 有效地探索了神经网络的稀疏性,自适应地保留了最有价值的注意力值。这使得能够在对全局通道上下文进行建模时有效地提取处理空间变化的降雨退化特征。相比之下,SPR-SA侧重于对空间背景进行建模,增强每个特征图的空间像素表示,并通过细粒度的局部特征促进准确的背景恢复。为了弥合 SPC-SA 和 SPR-SA 在空间通道和全局本地知识方面的差距,以及完全在这两种范式中集成特征,我们引入了 AAFM。AAFM利用两阶段渐进策略来全面对齐和融合特定于范式的特征。

3.2 Sparse Prompt Channel Self-Attention

如图2所示,SPC-SA中的自我注意机制沿着通道维度运行。具体来说,给定输入嵌入特征𝐹 ∈ R𝐻 ×𝑊 ×𝐶 ,点卷积(PWConv)和3×3深度卷积(DWConv)应用于𝐹聚合跨像素通道信息,生成查询矩阵𝑄, key 𝐾,和价值𝑉 . 接下来,我们对重塑后的图像执行点积操作𝑄 and 𝐾 生成密集的注意力矩阵𝑀 ∈ R𝐶 ×𝐶 . 然而,我们观察到,键中的标记并不总是与查询中的标记相关,使用不相关的标记估计的自我关注值会引入噪声交互和信息冗余,影响图像恢复的质量。为了解决这个问题,我们引入了一种不同于传统自我注意机制的Top-k机制,用于过滤注意矩阵中的信息,保留最重要的注意值,并避免在去噪过程中可能导致伪影的噪声。例如,与𝑘 = 4/5,我们只保留了前80%的注意力得分,而其余的元素则被掩盖为零。值得注意的是,我们还开发了一种新的可学习运算符:高效提示引导运算符(EPGO),它根据输入动态生成提示信息,引导𝐾如图3所示,与之前的研究[6,71]不同,我们提出了一种新的动态稀疏机制,充分利用了神经网络的稀疏性。从形式上讲,上述过程表示如下:
Ω i ( k ) = arg ⁡ max ⁡ S ⊂ { 1 , … , N } ∑ j ∈ S M i j , Ω ( k ) = { Ω 1 ( k ) , Ω 2 ( k ) , … , Ω N ( k ) } , (1-2) \begin{array}{l} \Omega_{i}^{(k)}=\arg \max _{S \subset\{1, \ldots, N\}} \sum_{j \in S} M_{i j}, \\ \Omega^{(k)}=\left\{\Omega_{1}^{(k)}, \Omega_{2}^{(k)}, \ldots, \Omega_{N}^{(k)}\right\}, \end{array}\tag{1-2} Ωi(k)=argmaxS{1,,N}jSMij,Ω(k)={Ω1(k),Ω2(k),,ΩN(k)},(1-2)
[ M k ] i j = { 1 ,  if  j ∈ Ω i ( k ) ⟺ 0 ,  otherwise  . M i j ∈ Top ⁡ k ( M i , : ) , (3) \left[M_{k}\right]_{i j}=\left\{\begin{array}{ll} 1, & \text { if } j \in \Omega_{i}^{(k)} \Longleftrightarrow \\ 0, & \text { otherwise } . \end{array} \quad M_{i j} \in \operatorname{Top}_{k}\left(M_{i,:}\right),\right.\tag{3} [Mk]ij={1,0, if jΩi(k) otherwise .MijTopk(Mi,:),(3)
这里,Ω(𝑘)𝑖表示第i行中前k个元素的索引集,即矩阵第i行中k个最重要元素的列索引𝑀. 从形式上讲,SPC-SA的过程表示为
S P C − S A = Softmax ⁡ ( T k ( Q K T d ) ) V , (4) S P C-S A=\operatorname{Softmax}\left(T_{k}\left(\frac{Q K^{T}}{\sqrt{d}}\right)\right) V,\tag{4} SPCSA=Softmax(Tk(d QKT))V,(4)
𝑇𝑘 (·)表示高效提示指南操作员调制后的Top-k选择操作。,以及√𝑑 表示用于控制点积大小的可选温度系数𝑄 and 𝐾 在应用softmax之前。与之前的大多数工作[17]类似,我们采用多头策略,将多头注意力的所有输出连接起来,然后通过线性投影获得最终结果。
在这里插入图片描述

高效的提示引导算子。由于固定𝑘 这导致了一种刚性的模式结构,无法用神经网络动态更新,它很难适应现实世界场景中的复杂降雨条件。为了解决这个问题,我们提出了EPGO,它为神经网络提供了动态提示信息。这将引导注意力矩阵进行最优选择,使模型能够在稀疏和密集注意力场景中优化注意力分配,同时保留当前特征中最有价值的信息。如图2所示,EPGO的架构如下:给定输入特性𝐹 ∈ R𝐻 ×𝑊 ×𝐶 ,首先使用具有隐藏ReLU激活和Sigmoid函数的两个线性层来生成提示引导特征。然后将这些特征展平为低维向量。最后,对低维向量进行平均,并将其与信道逐元素相乘𝐶 输入功能𝐹 ,适应特征的尺寸变化,并有效地为𝐾 价值观。在算法1中,我们概述了动态调整的过程𝐾 使用EPGO。

3.3 Spatial Pixel Refinement Self-Attention

与 SPC-SA 不同,SPR-SA 的动机是有效地对每个像素的空间信息进行建模并有效地提取局部细节。然而,现有的空间自我注意机制往往具有较高的计算成本,对局部细节建模能力有限[61]。为了解决这个问题,我们提出了一个简单的但有效的使用卷积的自我注意近似模块。通过捕获每个像素的位置信息,对特征进行重新加权,允许每个像素从所有通道的同一位置感知不同的退化信号。这种方法增强了模型处理脱轨任务空间变化的能力。具体操作如图2所示,计算公式如下:
F L = P W ( D W 3 × 3 (  Linear  ( F ) ) ) , F S P = G A P ( F L ) , F ′ = P W ( φ ( F S P ⊙ F L ) ) , (5-7) \begin{array}{c} F_{L}=P W\left(D W^{3 \times 3}(\text { Linear }(F))\right), \\ F_{S P}=G A P\left(F_{L}\right), \\ F^{\prime}=P W\left(\varphi\left(F_{S P} \odot F_{L}\right)\right), \end{array}\tag{5-7} FL=PW(DW3×3( Linear (F))),FSP=GAP(FL),F=PW(φ(FSPFL)),(5-7)
其中PW(·)表示逐点卷积,DW(·)x×x表示푝×푡深度卷积,GAP(·)表示全局平均池,푡(·)表示Gelu函数。

3.4 Adaptive Alignment Frequency Module

虽然 SPC-SA 和 SPR-SA 分别捕获全局通道特征和局部空间特征,但有效地整合来自这两个分支的信息成为一个关键挑战。一个直观的观察是,来自 CNN 的基于卷积的局部特征与来自 Transformer 的基于自我注意的全局特征以及空间和通道维度特征之间存在不确定的知识差距 [8, 10]。因此,简单地连接或添加这些特征不能完全最大化它们的潜力。为了解决这个问题,我们提出了AAFM。AAFM采用两阶段的过程,逐层逐步整合这两种范式的特征。首先,基于两个分支的特征类型,AAFM 沿空间或通道维度自适应地重新加权特征以对齐第一个范式(即空间通道)。然后,我们将特征引入频域,利用傅里叶变换来增强多个频率空间之间的交互。这允许每个像素从其他像素感知模式,将全局特征聚合为局部特征,将局部特征扩散到全局特征中,从而实现第二种范式(即全局-局部)的深度交互和融合。具体地说,给定两个分支的输入特征푡和푡,AAFM首先应用两种交互操作:空间对齐和通道对齐,分别生成空间注意图和通道注意图。然后将这些重新加权到相应的分支特征上,以实现有效的对齐和交互。该过程可以表示如下:
 Maps  = f ( P W ( φ ( P W ( F S P C ) ) ) ) ,  MapC  C = f ( P W ( φ ( P W ( G A P ( F S P R ) ) ) ) ) , F ^ = F S P R ⊙  Maps  S + F S P C ⊙  Map  C . (8-10) \begin{array}{c} \text { Maps }=f\left(P W\left(\varphi\left(P W\left(F_{S P C}\right)\right)\right)\right), \\ \text { MapC }_{C}=f\left(P W\left(\varphi\left(P W\left(G A P\left(F_{S P R}\right)\right)\right)\right)\right), \\ \hat{F}=F_{S P R} \odot \text { Maps }_{S}+F_{S P C} \odot \text { Map }_{C} . \end{array}\tag{8-10}  Maps =f(PW(φ(PW(FSPC)))), MapC C=f(PW(φ(PW(GAP(FSPR))))),F^=FSPR Maps S+FSPC Map C.(8-10)
为了利用频域的特征差异并弥合信息差距,我们将快速傅里叶变换 (FFT) 应用于融合后的特征ˆ丢脸。为简单起见,我们首先考虑单通道情况,即 ˆ푡 ∈ R푡 ×푡。xml的2D快速傅里叶变换定义为:

F ( F ^ ) ( u , v ) = 1 H W ∑ h = 0 H − 1 ∑ w = 0 W − 1 F ^ ( h , w ) e − j 2 π ( u h H + v w W ) , (11) \mathcal{F}(\hat{F})(u, v)=\frac{1}{\sqrt{H W}} \sum_{h=0}^{H-1} \sum_{w=0}^{W-1} \hat{F}(h, w) e^{-j 2 \pi\left(\frac{u h}{H}+\frac{v w}{W}\right)},\tag{11} F(F^)(u,v)=HW 1h=0H1w=0W1F^(h,w)ej2π(Huh+Wvw),(11)
𝑢 and 𝑣 表示变换空间中的频率坐标,F−1表示相应的逆变换(IFFT)。在我们的实现中,在应用FFT之前𝐹 ∈R𝐻 ×𝑊 ×𝐶 首先由线性层投影以放大高频信号,充当高通滤波器[27,39,56]。然后,我们使用FFT将特征分解为实部和虚部,(𝑅,𝐼)。从数学上讲,我们有:

R , I = FFT ⁡ ( Linear ⁡ ( F ^ ) ) , (12) R, I=\operatorname{FFT}(\operatorname{Linear}(\hat{F})),\tag{12} R,I=FFT(Linear(F^)),(12)
它产生了一个包含关键全局信息的复杂频谱。接下来,这些实部和虚部沿通道维度连接:
F = IFFT ⁡ ( Linear ⁡ ( [ R , I ] ) ) , (13) F=\operatorname{IFFT}(\operatorname{Linear}([R, I])),\tag{13} F=IFFT(Linear([R,I])),(13)
其中 [·] 表示通道连接,푡 是频域交互融合特征。第二个线性层进一步调制和细化频率分量,而逆 FFT 将它们转换回空间域以进行后续恢复阶段。

3.5 Multi-Scale Flow Gating Network

传统的前馈网络通常依赖于深度卷积来增强潜在特征的局部性,但它们往往忽略了多尺度特征表示在去除雨条纹方面的有效性[1,6]。为了解决这个问题,我们通过将不同尺度的卷积引入门控和值分支,将门控机制与多尺度表示学习相结合(见图 2)。这控制了专家信息在我们的管道的各个层次上的流动,促进了跨层次、多尺度信息的流动,有效地提取了多尺度局部细节。给定输入特征 푡 ,MSGN 的计算可以表述为:
F ^ = P W ( F ) , [ F ^ 1 , F ^ 2 ] = F ^ , F ^ ′ = Linear ⁡ ( D W 3 × 3 ( F ^ 1 ) ⊙ D W 5 × 5 ( F ^ 2 ) ) . (14-15) \begin{array}{l} \hat{F}=P W(F),\left[\hat{F}_{1}, \hat{F}_{2}\right]=\hat{F},\\ \hat{F}^{\prime}=\operatorname{Linear}\left(D W^{3 \times 3}\left(\hat{F}_{1}\right) \odot D W^{5 \times 5}\left(\hat{F}_{2}\right)\right) . \end{array}\tag{14-15} F^=PW(F),[F^1,F^2]=F^,F^=Linear(DW3×3(F^1)DW5×5(F^2)).(14-15)

4 Experiments

4.1 Experimental Settings

实施细节。在CPRAformer中,{푡1, 푡2, 푡3, 푡4} 设置为 {4, 6, 6, 8},CPRAformerB 四个级别的注意力头设置为 {1, 2, 4, 8}。初始通道푡设置为48。在训练过程中,我们使用补丁大小为64×64的Adam优化器,批大小为12,epoch数设置为300。详细的实验设置请参考补充剂。

数据和评估。我们遵循之前的大部分研究实践来训练和验证我们的模型 [3, 12, 23, 71, 2]。具体来说,我们使用从多个数据集[19,33,66,76,77]收集的13,712个图像对进行训练,并在5个合成数据集(Test100[77]、Rain100H[66]、Rain100L[66]、Test2800[18]、Test1200[75])和一个真实数据集[59]上评估我们的模型。上述数据集主要针对雨条纹去除。然而,雨滴代表了除雨任务的另一种污染形式。因此,我们在 Raindrop-A 和 Raindrop-B 数据集 [41] 上训练和评估我们的模型。与现有方法[20,25]一致,我们采用PSNR和SSIM作为上述基准的评价指标,均在YCbCr颜色空间中的Y通道(亮度)上计算。

4.2 Comparison with State-of-the-Art Methods

我们将CPRAformer与22种图像去雨方法进行了比较:RESCAN[31]、PreNet[45]、SPDNet[68]、PCNet[26]、MPRNet[72]、HINet[3]、ALformer[23]、DANet[24]、Uformer[61]、NAFNet[2]、MFDNet[58]、HCT-FFN[8]、DRSformer[6]、FSNet[12]、ChaIR[11]、OKNet[13]、AST[79]、SFHformer[27]、IRNeXT[14]、Nerd-rain[7]、MSDT[1]和AdaIR[15]。为了确保公平比较,我们使用官方源代码在我们的环境中从头开始重新训练上述所有方法,而无需任何预训练或微调。
在这里插入图片描述
在这里插入图片描述

雨条纹合成数据集。表 1 显示了五个基准数据集的定量评估结果,很明显我们的 CPRAformer 始终且显着优于现有方法。具体来说,与最近的最佳性能方法相比,AdaIR [15],CPRAformer 将所有数据集的平均性能提高了 0.52dB。在某些数据集(例如 Test100)上,增益达到 1.01dB。图 4 显示了最近方法生成的样本视觉质量的比较。由于双范式的相互作用和融合,CPRAformer有效地去除了雨纹,同时保留了背景图像的细节和逼真的纹理。此外,我们在图 7 中提供了“Y”通道直方图拟合曲线的比较,证实了去雨结果与统计分布中的地面实况的一致性。
在这里插入图片描述

雨滴合成数据集。我们对雨滴数据集[41]进行了进一步的实验,定量结果如表2所示,我们的模型获得了最高的性能。图 5 中的视觉比较表明,我们的方法在保留精细纹理细节的同时有效地去除了雨滴。这表明我们的模型达到了最佳性能在两种类型的降雨污染下,进一步证实了我们的CPRAformer的泛化能力。真实世界的数据集。为了进一步证明CPRAformer的泛化和鲁棒性,我们对真实世界的数据集[59]进行了比较。如图6所示,所有其他方法都在雨去除或细节恢复方面产生了次优结果。
在这里插入图片描述

相比之下,我们提出的CPRAformer优于其他方法,在具有挑战性的示例中实现了视觉上令人愉悦的恢复。这表明CPRAformer可以很好地推广到看不见的现实世界数据类型。
在这里插入图片描述

感知质量评估。我们遵循 [6, 79] 中的方法来评估我们提出的 CPRAformer 的感知质量。结果如表 3 所示,表明与其他方法相比,CPRAformer 实现了更低的 NIQE,这表明它在真实降雨场景中提供了更好的感知质量。

4.3 Ablation Studies

在本节中,我们对五个合成数据集进行了消融实验,以研究每个组件的效果。为了确保公平比较,所有消融研究都是在相同的环境和训练细节下进行的。由于空间限制,我们展示了两个数据集的结果以及所有五个数据集的平均值。补充剂中提供了进一步的消融实验。
在这里插入图片描述

双重聚合和双范式策略。为了研究同时使用SPC-SA和SPR-SA的效果,我们进行了多次实验,结果如表4所示。表的第一行和第二行表明,我们用SPC-SA或SPR-SA替换了CPRAformer中的所有注意模块。第三行表示CPRAformer中使用的两种注意机制的场景。此外,在此比较中没有一个模型使用 AAFM。我们观察到,当使用两种类型的自注意力时,实现了 31.56 dB 的最佳性能。这表明这两种范式的不同表示对于高质量的图像去雨至关重要。

高效的提示引导算子。为了验证EPGO的有效性,我们首先删除了Top-k机制和EPGO本身,实验结果如图8 (a)所示。据观察,EPGO 始终以出色的 PSNR 性能实现高保真恢复。EPGGO 的关键方面是通过提示信息生成动态 k 值,引导注意力矩阵过滤掉重要信息。为此,我们在五个数据集上测试了,将 EGO 生成的动态 k 值与固定 k 值进行比较,平均结果如图 8 (b) 所示。动态k值自适应地处理真实场景中复杂多变的雨纹,增强了模型的鲁棒性。
在这里插入图片描述

自适应对齐频率模块。我们通过综合消融实验验证了AAFM的有效性,结果如表5所示。具体来说,我们使用表4第三行的模型作为基线。首先,我们介绍了 AAFM 的第一个对齐阶段,获得了 0.12 dB 的增益。随后,我们添加了第二个融合阶段,与基线模型相比,获得了 0.41 dB 的增益。这表明 AAFM 最大化了这两种范式的特征优势,促进了信息的高频交互和深度融合。

多尺度流门控网络。为了验证 MSGN 的有效性,我们将其替换为标准前馈网络 (SFFN) [17]、深度卷积配备前馈网络 (DFN) [34] 和卷积门控线性单元 (ConvGLU) [46]。表 6 中的结果表明,MSGN 通过有效地表示潜在的多尺度感知信息和增强类之间的信息流来实现最佳性能。

4.4 Other Related Tasks

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

我们选择图像去雾来验证CPRAformer在图像恢复任务中的可扩展性和鲁棒性。继之前的大多数研究 [9, 37, 47, 48] 之后,我们训练和验证我们的模型。具体来说,我们使用了两个流行的去雾数据集,RESIDE-6K[29,47]和Haze-4K[36],并将CPRAformer与11种最先进的去雾方法进行了比较。定量结果如表8所示,表明CPRAformer在两个数据集上都取得了最佳性能。例如,在RESIDE-6K上,CPRAformer比之前的SOTA方法SFHformer提高了0.62 dB,这是一个显著的增强。此外,图9中的视觉比较表明,其他方法生成的图像具有不自然的阴影和高频区域,以及残留的雾霾。相比之下,CPRAformer 恢复了清晰的图像,保留了纹理和颜色细节,并最大限度地减少了雾霾残留物。此外,我们在下游任务上评估了CPRAformer。在目标检测中,使用 Google Vision API [6、21、50、69] 处理 10 个随机选择的图像,表 7 显示我们的方法获得了最好的平均识别。对于语义分割,使用了预训练的DeepLab v3[4],如图10所示,CPRAformer的输出最接近地面真实值。有关详细信息,请参阅补充。

5 Conclusion

在本文中,我们提出了一种基于双范式表示学习的新型图像去雨 Transformer 模型CPRAformer。具体来说,我们引入了 SPC-SA,它自适应地调整神经网络的稀疏性,增强了全局建模能力,同时促进了跨通道的专家信息流。此外,SPR-SA 强调降雨变化的空间分布,专注于局部特征提取。此外,我们提出了 AAFM 和 MSGN 来充分整合这两种范式的特征,促进不同类型表示之间的交互并实现跨尺度特征交互。在10个基准数据集上的广泛实验表明,CPRAformer具有较强的泛化能力和鲁棒性。


至此本文结束。

如果本文对你有所帮助,请点赞收藏,创作不易,感谢您的支持!

点击下方👇公众号区域,扫码关注,可免费领取一份200+即插即用模块资料

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐