论文题目:FSDC-DETR: A Frequency-Spatial Domain Collaborative DETR for Small Object Detection(FSDC-DETR:一种用于小目标检测的频域-空域协同DETR)

会议:ECCV 2026

摘要:在实际应用中,小目标检测仍然是一项具有挑战性的任务。尽管最近取得了进展,但现有的检测器仍然受到僵化处理的限制,这些处理将空间聚集与隐含的频率混叠和截断纠缠在一起,导致对SOD高频分量的保存不足。为了解决这些局限性,我们提出了一种频率-空间域协同检测转换器(FSDC-DETR),这是一种新的协作框架,显式地建模互补的空间和频率表示。具体地说,我们首先引入了双分支频率-空间自适应融合(DBFSAF)来增强频率分集并自适应地捕获频率-空域区分表示。在这些表示的基础上,在混合编码器内进一步探索频率-空间交互方案,以使得能够将渐进特征传播到解码器。特别是,通过分流频率-空间特征融合(SFS-FF)实现了结构感知的频率-空间聚合,在频率和空间表示之间建立了双向交互和渐进的跨尺度传播,用于相干判别建模。同时,通过频率-空间动态下采样(FSD-Down)在尺度转换期间保留信息丰富的高频响应,从而在多尺度融合过程中最大限度地减少频率退化以获得精确的SOD。实验结果表明,FSDC-DETR达到了最先进的性能,在VisDrone-DET2019和AITODv2上分别提高了6.4和6.6的AP,对于小对象分别提高了6.8和6.9 AP。

代码可在https://github.com/nevereverinsomnia/FSDCDETR.上获得


FSDC-DETR:用频率-空间协同建模突破小目标检测瓶颈

一、背景与动机:小目标检测为何如此难?

小目标检测(Small Object Detection, SOD)是计算机视觉领域长期存在的挑战性任务,在无人机航拍、卫星遥感、工业缺陷检测、医学影像分析等场景中有着广泛的实际需求。

近年来,以 DETR 为代表的端到端 Transformer 检测器凭借去除锚框和 NMS 的优雅设计,在通用目标检测上取得了显著进展。RT-DETR、DEIMv2 等变体进一步提升了推理效率和收敛速度。然而,这些先进检测器在面对小目标时依然表现出明显的性能瓶颈,原因可以归结为以下三个层面:

1.1 特征表示能力不足

小目标在图像中仅占极少数像素,空间信息极为稀疏。随着网络层数加深,特征图分辨率不断下降,小目标的特征极易在层级结构中被逐渐淹没,导致特征损失和表示不充分。

1.2 CNN 与 ViT 的频率特性差异被忽视

DEIMv2 引入了"DINOv3预训练ViT + 轻量CNN"的双分支架构,试图融合全局语义建模与局部结构提取的优势。然而,这两类骨干网络在频率域上存在本质差异

  • ViT 因全局注意力的聚合机制,天然表现出低通滤波特性,倾向于过度平滑特征,削弱局部建模能力;
  • CNN 因局部感受野,能天然保留更强的高频分量,但全局建模能力受限。

DEIMv2 仅通过通道拼接后接 1×1 卷积来融合两支特征,完全没有考虑两者的频率域异质性,可能导致频率混叠效应,阻碍有效信息互补。

【配图】论文 Figure 1:四种骨干结构(CNN、ViT、DEIMv2、FSDC-DETR)的频率响应分析对比图。可以清晰看到,CNN 频率响应集中在高频区,ViT 集中在低频区,DEIMv2 的融合频率响应不够丰富,而 FSDC-DETR 的各通道频率响应分布更广、更均衡。

1.3 多尺度融合中的频率降级问题

传统的卷积下采样在进行空间缩减时,会引入频率混叠伪影,高频响应被无意间衰减。而高频信息(目标边界、精细纹理)恰恰是小目标精准定位的关键线索。主流混合编码器(RT-DETR、DEIMv2等)在跨尺度特征融合时均依赖传统卷积下采样,缺乏对频率完整性的保护机制。


二、FSDC-DETR 整体框架

针对上述三大问题,本文提出 FSDC-DETR(Frequency-Spatial Domain Collaborative Detection Transformer),以 DEIMv2-L 为基础,构建了一个统一的频率-空间协同检测流水线,核心思路是:显式地建模互补的空间表示与频率表示,并在整个检测流程中持续构建、传播和保护频率感知特征

整体框架由三个关键模块构成:

  1. DBFSAF(双分支频率-空间自适应融合):作用于双分支骨干网络的输出,解决频率混叠与截断问题;
  2. SFS-FF(分流频率-空间特征融合):作用于混合编码器,实现跨尺度的频率-空间协同聚合;
  3. FSD-Down(频率-空间动态下采样):替代传统卷积下采样,在尺度转换时保护频率完整性。

【配图】论文 Figure 2:FSDC-DETR 整体架构图。展示了 ViT + CNN 双分支骨干、DBFSAF 模块、FSC-Hybrid Encoder(含 SFS-FF 和 FSD-Down)以及解码器的完整数据流。


三、核心创新模块详解

3.1 DBFSAF:双分支频率-空间自适应融合

这是整个框架的第一个关键模块,负责处理 HGNetv2(CNN)和 DINOv3(ViT)输出的双分支特征,弥合两者的频率域鸿沟。

【配图】论文 Figure 3:DBFSAF 模块的详细结构图,展示了 FDConv、Partial 分割、MKSRU 和 FPU 的协同工作流程。

工作流程分三步:

第一步:频率动态卷积(FDConv)
将来自 HGNetv2 的低频特征图 $F_L^P$ 和来自 DINOv3 的高频特征图 $F_H^P$ 进行通道拼接,再输入 FDConv。FDConv 能够在保持判别性高频分量的同时,实现动态频率多样化,增强整体特征的频谱覆盖范围。

第二步:Partial 通道分割
通过超参数 γ 将 FDConv 的 C 通道输出做分割:

  • $C \times \gamma$ 个通道的特征 $F_{FS}^P$:送入后续的频率-空间联合精化(PFSR);
  • $C \times (1-\gamma)$ 个通道的特征 $F_C^P$:直接保留,减少冗余的通道间交互。

这种 Partial 设计在鲁棒性和精度之间取得了良好平衡,同时降低了不必要的计算量。

第三步:PFSR 协同精化(MKSRU + FPU)
$F_{FS}^P$ 分两路处理:

  • MKSRU(多核空间精化单元):采用 5×5 深度卷积分割后,分别用不同膨胀率的 7×7 深度卷积处理,捕获多尺度空间结构线索,最终通过 SiLU 激活的门控机制输出空间精化特征 $F_S^P$
  • FPU(频率处理单元):对频率敏感响应进行精化,输出 $F_F^P$

两路特征经过 GAP + Softmax 的通道注意力融合(带可学习参数 α 和 β),最终与保留的 $F_C^P$ 拼接后,输出完整的频率-空间协同表示 $F^P$

DBFSAF 的核心价值在于:它明确利用了 ViT 与 CNN 互补的频率特性,通过增加频谱多样性、保护判别性高频细节、抑制冗余通道交互,为后续模块提供质量更高的频率感知表示,这对边界精准定位尤为重要。

消融实验数据有力证明了这一点:单独加入 DBFSAF 就使 VisDrone-DET2019 上的 AP 从 24.7 提升到 29.7(+5.0),APS 从 14.2 提升到 19.8(+5.6),是三个模块中单独贡献最大的。


3.2 SFS-FF:分流频率-空间特征融合

SFS-FF 作为 FSC-Hybrid Encoder 的核心组件,解决了现有混合编码器在跨尺度特征融合中隐式衰减高频分量的问题。

【配图】论文 Figure 4:SFS-FF 模块结构图,展示了三路分流设计(FFT分支、CSP空间分支、残差分支)的并行处理与融合方式。

给定当前尺度输入 $F_{in} \in \mathbb{R}^{C \times H \times W}$ 和来自更高分辨率的输入 $\hat{F}_{in} \in \mathbb{R}^{C \times 2H \times 2W}$,SFS-FF 的核心操作如下:

第一步:三路分流
$F_{in}$ 与经过 FSD-Down 下采样的 $\hat{F}_{in}$ 拼接后,通过 1×1 卷积分流为三路:

  • $F_S$(C/2 通道):空间精化分支;
  • $F_F$(3C/8 通道):频率精化分支;
  • $\hat{F}$(C/8 通道):残差连接分支。

第二步:双路并行处理

  • 频率分支:对 $F_S$ 进行 FFT → Conv3×3 → IFFT,在频域做卷积运算,精确捕获频率结构;
  • 空间分支:对 $F_F$ 进行 SRM(空间精化模块)处理,增强空间结构感知。

第三步:三路融合输出
三路结果拼接后经 1×1 卷积输出 $F_{out}$,实现了频率与空间表示的双向交互和跨尺度的渐进式传播

这种分流设计的优势在于:频率分量和空间分量被显式解耦后分别精化,再协同融合,既保证了结构感知的精确性,又不会因合并处理而导致细粒度细节被抑制。


3.3 FSD-Down:频率-空间动态下采样

传统卷积下采样(包括步长卷积、平均池化等)在空间分辨率降低的同时,会隐式引入频率混叠。UAV-DETR 虽然尝试了"平均池化 + FFT"的方案,但平均池化本质上是低通滤波器,在进行频率建模之前就已经损失了高频信息

FSD-Down 从根本上解决了这一问题,以可学习的小波分解为核心,实现频率完整性的保护。

【配图】论文 Figure 5:FSD-Down 模块结构图,展示了 DWT 分解四子带、GConv 并行处理、通道注意力融合与可学习缩放因子 ρ 的完整流程。

工作机制:

第一步:双路并行特征提取

  • DWT 路径:对输入 $F_{in} \in \mathbb{R}^{C \times H \times W}$ 进行 2D 离散小波变换,分解为四个子带:LL(低频近似)、LH(水平高频)、HL(垂直高频)、HH(对角高频),空间分辨率降为 $\frac{H}{2} \times \frac{W}{2}$,通道数变为 4C。小波变换天然无损地保留了所有频率分量;
  • GConv 路径:对 $F_{in}$ 进行分组卷积(kernel=2, stride=2, groups=C),捕获空间结构信息,同样输出 $\frac{H}{2} \times \frac{W}{2}$ 的特征。

第二步:通道注意力计算
将两路特征拼接后,通过 GAP + Sigmoid 计算通道注意力权重 $F_{CA}$,自适应地决定哪些频率子带和空间结构信息更具判别性。

第三步:自适应频率调制输出
$F_{out} = \text{Conv}{1\times1}(\rho \odot F{CA} \odot \text{DWT}(F_{in}) + F_{CA} \odot \text{Conv}{1\times1}(\text{GConv}(F{in})))$

其中 ρ 是可学习缩放因子,能够让模型自适应地强调对 SOD 最具判别性的频率模式和局部对比度。

FSD-Down 的核心优势在于:以小波变换替代卷积作为下采样算子,从根源上杜绝了频率混叠,同时通过注意力机制和可学习参数保持了高频响应的空间一致性。


四、实验结果

4.1 数据集

  • VisDrone-DET2019:14,018 张无人机拍摄图像,10 类目标,平均每张图像包含 40.7 个目标实例,场景密度变化极大,是 SOD 的经典高难度基准;
  • AITODv2:28,036 张航拍图像,752,745 个标注实例,8 类目标,平均目标尺寸仅 12.7 像素,86% 的实例小于 16 像素,极具挑战性。

所有实验均在 800×800 输入分辨率下进行,使用 8×NVIDIA H200 GPU 训练 100 个 epoch。

4.2 主实验对比

【配表】论文 Table 1:在 VisDrone-DET2019 和 AITODv2 测试集上与主流检测器的定量对比,包含 YOLOv11/12/13、D-FINE、DEIMv2、RT-DETRv4 等不同规模模型的全面比较。

VisDrone-DET2019 测试集结果:

FSDC-DETR(参数量 40.3M,基于 DEIMv2-L 构建)取得了 31.1 AP,相比基线 DEIMv2-L(24.7 AP)提升 6.4 AP。更细粒度的指标同样表现优异:

  • AP50 达到 52.3,分别超越 DEIMv2-L 和 RT-DETRv4-L 9.0 和 6.6 个百分点;
  • AP75 从 24.6 提升至 31.9(+7.3),反映出更精准的边界框定位能力;
  • APS 从 14.2 提升至 21.0(+6.8),相对提升约 48%,这是最能体现小目标检测能力的核心指标。

AITODv2 测试集结果:

FSDC-DETR 取得 32.3 AP63.9 AP50,相比 DEIMv2-L 分别提升 6.6 AP 和 8.2 AP50,相比 RT-DETRv4-L 领先 4.7 AP。小目标指标 APS 从 24.4 提升至 31.3(+6.9),在极端小目标场景下的改进同样显著。

值得注意的是,FSDC-DETR 超越了参数量更大的 D-FINE-X(62.0M,26.6 AP on VisDrone)、DEIMv2-X(50.0M,26.5 AP)等规模更大的模型,以适中的参数量实现了性能的全面超越

4.3 消融实验

【配表】论文 Table 2:三个模块(DBFSAF、SFS-FF、FSD-Down)的逐步消融实验结果,在 VisDrone-DET2019 测试集上进行。

消融实验在 VisDrone-DET2019 测试集上系统验证了三个模块的独立贡献和协同效果:

配置 AP AP50 APS 相对基线
基线(DEIMv2-L) 24.7 43.3 14.2
+ DBFSAF 29.7 49.7 19.8 +5.0 AP
+ SFS-FF 25.9 44.9 15.5 +1.2 AP
+ FSD-Down 25.4 44.2 15.1 +0.7 AP
+ SFS-FF + FSD-Down 26.3 45.5 16.4 +1.6 AP
+ DBFSAF + FSD-Down 30.0 50.5 19.8 +5.3 AP
+ DBFSAF + SFS-FF 30.3 50.9 20.0 +5.6 AP
全部三个模块 31.1 52.3 21.0 +6.4 AP

关键发现:

  1. DBFSAF 是最核心的模块,单独使用就贡献了 +5.0 AP,说明双分支频率-空间自适应融合对于解决骨干网络的频率域异质性问题效果最为直接;
  2. 三个模块的贡献相互独立且互补:将任意两个模块组合后,再加入第三个模块均有进一步提升,最终三者协同达到最优的 31.1 AP;
  3. APS 的持续增长从 14.2 → 19.8 → 20.0 → 21.0,清晰表明频率感知建模对小目标定位精度的系统性提升。

4.4 超参数消融

【配表】论文 Table 3:DBFSAF 中 Partial 比例超参数 γ 的敏感性分析实验。

对 DBFSAF 中分割比例 γ 的敏感性分析显示:γ 从 0 增大到 0.5 时,AP 持续提升;γ = 0.5 取得最优结果(31.1 AP,21.0 APS);γ 进一步增大至 0.625 和 1 时性能略有下降,说明过度的精化会引入冗余交互。γ = 0 时的明显性能下降(29.7 AP vs 31.1 AP)进一步验证了 PFSR 精化过程的有效性。

4.5 可视化分析

【配图】论文 Figure 6:FSDC-DETR、RT-DETRv4、DEIMv2 在 VisDrone-DET2019 测试集上的小目标检测可视化对比,橙色框为局部放大区域。

【配图】论文 Figure 7:FSDC-DETR、RT-DETRv4、DEIMv2 在 AITODv2 测试集上的检测可视化对比,绿色框为局部放大区域。

定性可视化结果与定量指标高度一致:

  • 在 VisDrone-DET2019 上,FSDC-DETR 的目标边界更清晰,预测框与真值的对齐程度更高;在复杂背景下能有效抑制误检,同时保持对密集小目标的鲁棒性;
  • 在 AITODv2 上,FSDC-DETR 对极小实例的定位更精准,在竞争方法出现漏检或误检的场景下依然保持稳定的检测性能。

五、方法总结与思考

FSDC-DETR 的核心贡献在于将"频率感知"这一视角系统地引入了 DETR 检测框架,并通过三个精心设计的模块,分别解决了表示构建、跨尺度传播和尺度转换保护三个阶段的频率降级问题。

从更宏观的视角来看,FSDC-DETR 揭示了一个重要规律:SOD 的瓶颈不仅仅是"看得到"(特征表示能力),更在于"保得住"(高频信息的保护与传播)。传统检测器默认忽视的频率域,恰恰是小目标检测的关键信息载体。

本文的思路也提供了一种通用的改进范式:识别不同骨干的频率特性差异 → 在融合阶段显式弥合频率鸿沟 → 在传播阶段协同扩散频率信息 → 在下采样阶段防止频率降级,这四步思路对于未来的 SOD 研究具有较强的参考价值。

实验结果在两个极具挑战性的 SOD 基准上均取得了全面的 SOTA 性能,VisDrone-DET2019 上 AP 提升 6.4(其中小目标 APS 提升 6.8,相对提升近 48%),AITODv2 上 AP 提升 6.6(APS 提升 6.9),充分验证了频率-空间协同建模对小目标检测的系统性增益。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐