U-Shape Transformer for Underwater Image Enhancement
《U-Shape Transformer for Underwater Image Enhancement》发表于IEEE Transactions on Image Processing 2023 年第 32 卷,提出了一种基于 U 型 Transformer 的水下图像增强方法,构建了大规模水下图像数据集 LSUI,并设计了多色空间损失函数,有效提升了水下图像增强的性能。
整体结构图:

SGFMT:输入特征图通过线性投影转化为一维序列然后嵌入位置编码进入Transformer层(每一个Transformer层包含一个多头注意力块(MHA)和一个前馈神经网络(FFN)),得到输出序列后通过特征映射转化为输出特征图。

为什么要分成四分输入?
多尺度特征提取需求:水下图像不同区域在不同分辨率下蕴含的信息不同(如整体结构、细节纹理)。四份输入分别对应不同尺度的特征图(尺寸依次为 (H \times W \times C_1)、(\frac{H}{2} \times \frac{W}{2} \times C_2)、(\frac{H}{4} \times \frac{W}{4} \times C_3)、(\frac{H}{8} \times \frac{W}{8} \times C_4)),通过对多尺度特征的并行处理,确保网络既能捕捉图像全局结构,也能关注局部细节。例如,大尺寸特征图保留更多细节,小尺寸特征图侧重全局语义,四份输入覆盖了从细粒度到宏观的多尺度信息。
为什么将特征图分成1,2,,,d这么多块?
特征分块与线性投影处理:每份特征图进一步划分成 “1, 2, …, d”,是为了执行线性投影操作。通过将二维特征图划分为多个局部块(d 为划分的块数),再对每个块进行线性投影,可将特征图转换为一维特征序列(如 (d \times C_1))。这一步是为后续融入位置嵌入(Position Embedding)、计算通道注意力做准备,使网络能够基于局部块特征捕捉不同颜色通道间的关联,强化对衰减严重通道的关注。简言之,分成四份是为了处理多尺度特征,而每份内部分成 “1, 2, …, d”,则是为了适配线性投影与后续注意力计算,最终实现通道维度的多尺度特征融合。





更多推荐



所有评论(0)