【医学影像 AI】UoloNet:基于多任务增强的小目标医学分割模型
更多内容请关注【医学影像 AI by youcans@Xidian 专栏】
【医学影像 AI】UoloNet:基于多任务增强的小目标医学分割模型
0. 论文简介
0.1 基本信息
2024年,Kejia Zhang 等 在 Artif Intell Rev 发表论文 【UoloNet:基于多任务增强的小目标医学分割模型】(UoloNet: based on multi-tasking enhanced small target medical segmentation model)。
论文下载: springer
引用说明: Zhang, K., Zhang, L. & Pan, H. UoloNet: based on multi-tasking enhanced small target medical segmentation model. Artif Intell Rev 57, 31 (2024). https://doi.org/10.1007/s10462-023-10671-5

0.2 论文概览
为解决 UNET 及其衍生模型在小目标医学图像分割中因缺乏目标整体特征建模导致的离散噪声点问题、精度下降等问题,本文提出UoloNet 模型—— 在 UNET 基础上新增基于 YOLO 的目标检测分支,通过语义分割与目标检测的共享学习提升模型对目标整体特征的掌握,推理阶段融合两任务功能以有效去除分割中的离散噪声点,并采用CIOU 损失替代 YOLO 中的 IOU 损失进一步提升模型整体精度。
核心机制
- 双任务共享学习:
在 UNET 基础上新增基于 YOLO 的目标检测分支,共享编码器提取的多语义特征,使模型同时掌握目标的像素级分割信息(来自 UNET 解码器)与整体位置 / 形状信息(来自 YOLO 检测分支),从特征层面减少噪声产生的可能性; - 推理阶段噪声去除:
模型输出预分割 Mask(M̂)后,利用目标检测分支筛选出置信度 > 0.5 的候选框,经 NMS 处理生成目标框掩码(B̂,目标区域像素为 1,其余为 0);将 B̂与 M̂做 Hadamard 运算,仅保留目标框内的分割区域,直接剔除框外的离散噪声点;同时通过 “Mix>0.5” 的重叠度判断,确保目标区域内有效分割结果不丢失。
现有模型局限
- UNET 及其衍生模型问题:
虽在浅层结构医学图像分割中应用广泛(如 UNET++、UNET3+、nnUnet),但因缺乏目标整体特征建模,小目标分割时易产生离散噪声点,导致模型精度下降,影响临床病因诊断与治疗决策。 - 传统多任务模型缺陷:
现有多任务分割模型多基于 Anchor 模型(如 RCNN 系列)与 UNET 结合,存在参量大、无法端到端训练、特征提取结构重复导致计算资源浪费的问题,难以适配医学图像这类小规模数据集。
技术基础选择
- UNET:
编码器 - 解码器结构,通过跳连保留低层特征,是医学图像分割的主流框架,但小目标分割性能不足。 - YOLO:
轻量级目标检测模型,特征提取层与 UNET 编码器结构相似,检测速度快,支持端到端训练,适合与 UNET 融合构建轻量多任务模型。
核心架构组成
- 共享编码器:
提取图像特征,输出含 Mask 信息与目标识别信息的多语义特征图(H),供分割与检测任务共享 - 目标检测模块:
实现目标定位与分类,输出检测向量,为后续噪声去除提供目标区域信息 - Mask 生成模块(解码器):
生成初始分割 Mask,为后续与目标框融合做准备
核心结论
UoloNet 通过 “语义分割 + 目标检测” 双任务模式、CIOU 损失替代 IOU 损失、目标框辅助去除 Mask 离散噪声的流程,有效解决了小目标医学图像分割的精度低、收敛慢、噪声多的问题,在 SEHPI 和 LITS 数据集上均验证了有效性。
主要贡献
- 提出基于 UNET 的多任务模型(UoloNet),实现小目标肿瘤的分割(Mask 生成)与检测(目标定位),支持端到端训练;
- 设计适用于双任务的端到端损失函数,通过 α 超参数优化两任务损失权重,提升模型收敛速度;
- 利用目标检测模块输出的目标框,与预分割 Mask 做融合运算,解决了小目标分割中的离散噪声点问题,进一步提升分割精度。

0.3 摘要
近年来,UNET(Ronneberger 等人,2015 年)及其衍生模型已广泛应用于结构较浅显的医学图像分割任务,且取得了优异的分割效果。但由于该类模型缺乏对目标整体特征的建模,在小目标分割任务中会产生离散噪声点,导致模型精度和实际应用效果下降。
为此,我们提出了一种多任务医学图像分析模型 UoloNet,该模型在 UNET 的基础上新增了一个基于 YOLO(Redmon 等人,2016 年;Shafiee 等人,2017 年)的目标检测分支。通过语义分割与目标检测两大任务的共享学习,模型对目标整体特征的掌握能力得到提升。在推理阶段,融合目标检测与语义分割的功能可有效去除分割结果中的离散噪声点,进而提高语义分割的精度。此外,针对目标检测任务可能导致语义分割任务收敛过度的问题,该模型在 YOLO 中采用 CIOU(Zheng 等人,2020 年)损失替代 IOU 损失,进一步提升了模型的整体精度。
在我们发布的 MRI 数据集 SEHPI 以及公开数据集 LITS(Christ,2017 年)上的实验,均验证了所提模型的有效性。
1. 引言
编码器 - 解码器网络已成为语义分割领域的主流方法,它凭借简洁优良的结构,能够完成小规模数据集下的图像分割任务。在这类网络中(Ronneberger 等人,2015 年;Badrinarayanan 等人,2017 年;Chen 等人,2018 年),编码过程借助池化层逐步减少位置信息并提取抽象特征,解码过程则逐步恢复位置信息,最终实现图像掩码(Mask)的生成。由于性能出色,编码器 - 解码器网络还被广泛应用于其他领域,在医学图像分割领域的应用尤为突出,其中最具代表性的便是 UNET 框架。UNET 框架不仅结构相对简洁,还能实现优异的分割效果,因此应用广泛。与此同时,各类 UNET 变体模型的提出也丰富了 UNET 家族(Zhou 等人,2018 年;Çiçek 等人,2016 年;Milletari 等人,2016 年;Huang 等人,2020 年),这些变体从剪枝操作、注意力机制、掩码优化等多个角度进一步提升了分割精度。此外,UNET 结构还与目标检测模型等其他基础模型相结合,以实现多任务同步执行的效果。然而,传统的组合式目标检测模型规模较大,无法实现端到端输出,且训练过程复杂;同时,该类模型对于医学图像这类小规模数据集的适配性不足,在小规模医学数据集上,这种适配性欠缺的问题可能会更为显著。
与较大目标的分割任务不同,在小目标分割过程中,离散点噪声的出现具有不可逆性。目前亟需一种机制来减少预测过程中产生的离散点噪声,因为这种噪声会对临床管理造成限制,最终影响病因诊断、治疗方案制定以及监测数据的准确性。同时,在临床实践中,同一区域的专科医生对某一类别肿瘤的认知通常是一致的;但在语义分割阶段,由于目标分割基于像素级操作,可能会导致同一区域被预测出多个标签的情况,这会大幅降低模型的预测精度,并给后续临床治疗工作带来困扰。
现有的多任务分割模型主要基于锚点(Anchor)模型(Wang 等人,2017 年)与 UNET 的组合构建,这种方法操作简单,只需将两部分进行串联即可。但在传统目标检测模型(如 RCNN 系列(Girshick 等人,2014 年;Ren 等人,2015a 年;He 等人,2017a 年))中,计算量极大,且图像特征提取过程需要单独固定参数并训练网络,难以实现端到端训练;同时,后续 UNET 中用于下采样的特征提取结构存在重复,会造成计算资源的浪费。因此,本文旨在简化多任务模型。由于 YOLO(Redmon 等人,2016 年)的特征提取层与 UNET 编码器结构具有相似性,本文提出在编码和下采样过程中将两者结合,以实现目标识别中的特征提取。
YOLO 系列模型在提升模型预测速度方面取得了显著突破。同时,YOLO 模型本身是一种相对轻量化的特征提取模型,且其编码结构符合编解码器结构的设计逻辑。因此,本文考虑结合 YOLO 模型与 UNET 结构中编码器的优势,在传统 UNET 基础上新增一个目标检测分支,构建出一种新模型。该新模型能够实现轻量化多任务模型的设计目标,并在医学影像领域同时完成目标分割与目标识别任务。
在传统目标识别框架中,通常利用目标框来计算交并比(IOU)以进行比较,但 IOU 回归存在明显缺陷。当两个目标框不相交时,传统 IOU 无法表示它们之间的距离,也无法反映目标框的外观宽高比以及中心点宽高比的差异。这会导致模型在训练过程中出现瓶颈、训练效果不佳等问题。为缓解上述问题并提升模型收敛性,本文提出采用完全交并比(CIOU,Zheng 等人,2020 年)替代传统 IOU 来对目标框进行比较。CIOU 边界框损失函数能够通过迭代不断将预测框向真实框靠近,还能确保预测框的宽高及宽高比与真实框尽可能接近,从而加快预测框的回归收敛速度。这一改进在很大程度上实现了模型的稳定收敛,不仅促进了收敛速度的提升,还提高了模型的预测精度。
本文提出的多任务方法不仅解决了肿瘤直接分割的问题,还解决了训练过程中因负样本过多导致的训练不稳定问题。我们通过目标定位任务来提升分割任务的性能,在最终实验中,还优化了不同参数对模型收敛的增益程度,并增加了一些小轨迹,尽可能缩短多任务模型的训练时间。与现有方法不同,本文的分割对象为小标签目标,所提模型能够通过端到端的网络训练,同时实现目标的定位与标记,且训练时间短、模型收敛快。本文的主要贡献如下:
- 针对肿瘤目标的识别与分割,提出一种基于 UNET 模型的多任务目标识别分割方法,该网络既能实现掩码(MASK)分割,又能完成小目标肿瘤的识别。
- 针对目标识别与分割任务,设计一种识别与分割训练损失函数(LOSS 函数),使模型能够实现端到端训练;同时,为解决目标分割任务中收敛速度慢的问题,采用 CIOU 替代传统 IOU,并通过实验验证了其有效性。
- 针对掩码(MASK)预测过程中产生的噪声,利用模型生成的目标框设计了一种预测流程,该流程能够解决 MASK 预测过程中产生的离散噪声问题,进一步提升肿瘤预测效果。
2. 相关工作
随着深度学习的快速发展,许多基于卷积神经网络(CNN)的方法在语义分割领域取得了显著成果,这些方法可应用于驾驶区域分割任务,并能生成像素级分割结果。全卷积网络(FCN,Long 等人,2015 年)首次提出了全卷积网络结构,该结构能够融合不同尺度的特征图。然而,由于其对细节的固定能力有限,容易丢失细节信息,且对空间一致性的要求较高。
SegNet(Badrinarayanan 等人,2017 年)采用反池化层对特征图进行采样,能够保留细节的完整性,但低分辨率特征图会忽略邻近像素的信息。反卷积网络(Deconvnet,Noh 等人,2015 年)通过不同位置的滤波器补充细节并捕捉形状信息,但其在细节处理方面仍存在问题。DeepLab 采用带有空洞卷积连接条件的随机机场(原文 “random airport” 疑为表述偏差,结合领域知识推测为 “随机采样” 或相关结构),但获取的预测结果仅为原始输入的 1/8。金字塔场景解析网络(PSPNet,Zhao 等人,2016 年)提出使用金字塔模块聚合背景信息,不过其采用的不同金字塔池化模块对细节的要求更高。边缘网络(EdgeNet,Plastiras 等人,2019 年)将边缘检测与分割任务相结合,能够在不影响推理速度的前提下,得到更精准的分割结果。图卷积网络(GCN,Defferrard 等人,2016 年)提出了采用大规模卷积核的编码结构,但该结构的参数计算更为复杂。
上述方法在小细节目标分割方面并非最优,且在计算过程中对数据集和模型的要求较高,亟需降低这些要求。针对小目标语义分割,UNET 模型将编码器中的特征传递至每个阶段的上采样特征中,并采用跳连方式,使解码器能够学习编码器损失的相关性。凭借优异的分割性能,UNET 逐渐成为医学图像分割领域的主流模型。三维 UNET(3D UNET,Korez 等人,2016 年)借助 GPU 存储和计算能力的提升,以三维体数据作为输入;三维 U 型网络结构同时也是外部分割子网络的主干结构。尽管 3D UNET 性能出色,但通常需要采用流式处理方式:具体而言,需将三维体数据依次切割成小块,分别输入网络得到输出结果,再将输出结果拼接起来以获得最终分割结果。由于大多数肿瘤图像处于背景区域,这种处理策略会造成计算资源的浪费。
目前,主流目标检测算法可分为两阶段方法和单阶段方法。区域建议生成技术已历经多个发展阶段(Girshick 等人,2014 年;Girshick,2015 年;Ren 等人,2015b 年;He 等人,2017b 年)。Faster R-CNN 具有出色的检测和定位能力,但该方法通常会固定网络提取网络的一部分,导致模型无法进行端到端训练;同时,其模型参数规模较大,对于医学图像这类小规模数据集的适配性较差。
SSD 系列算法(Liu 等人,2015 年;Yi 等人,2019 年)和 YOLO 系列算法(Redmon 等人,2016 年;Shafiee 等人,2017 年)是单阶段目标检测方法中的里程碑式成果,这类算法能够同时完成边界框预测和目标分类任务。其中,YOLO(Redmon 等人,2016 年)将图像划分为 S×S 的网格,无需借助区域建议网络(RPN)提取区域建议,大幅提升了检测速度;YOLO9000(Redmon 和 Farhadi,2017 年)引入了锚点机制,进一步提高了检测召回率。
多任务学习旨在通过多个任务间的信息共享学习更优的特征表示,尤其是基于 CNN 的多任务学习方法,还能实现网络结构的卷积共享。Mask R-CNN(He 等人,2017a 年)通过为 R-CNN 新增一个分支,本质上实现了实例分割与目标检测任务的结合,这两个任务能够相互提升性能。CFUN(Xu 等人,2018 年)构建了一个双任务模型,结合 Faster R-CNN 和 UNET 网络,用于执行心脏分割与识别任务。DLT-NET(Qian 等人,2019 年)继承了编码器 - 解码器结构,并通过构建提交解码器之间的上下文关联,实现任务间特定信息的共享。Covering R-CNN(Girshick 等人,2014 年)网络能够同时完成目标识别、分类与分割任务。目前已有研究者尝试将 Mask R-CNN 应用于医学图像领域。
CaraNet(Lou 等人,2022 年)针对医学小目标提出了上下文轴向保留注意力网络(Context Axial Reserve Attention Network),与近年来的多种先进模型相比,该网络提升了小目标的分割性能。某研究(Liu 等人,2022 年)通过融合区域、边界和像素级信息,设计了一种多尺度结构损失,用于监督特征融合和精准分割。Rfa 和 Fga(2019 年)提出的方法侧重于解决分割任务中的效率问题,采用了优良的预处理方法,且模型采用了基于图谱和聚类的方案。某研究(Ngo 等人,2020 年)提出了一种结合膨胀卷积和多任务学习的肿瘤精确定位方法,但该方法在肿瘤边界识别方面的效果欠佳。混合分割网络(HSN,Chen 等人,2019 年)基于卷积神经网络提出了一种混合分割网络,可自动从计算机断层扫描(CT)图像中分割小细胞肺癌(SCLC);同时,该网络还设计了混合特征融合模块,以有效融合二维和三维特征,并对两个卷积神经网络进行联合训练。
3. 方法
3.1 定义
设 R \mathbb{R} R表示实数集。首先,定义数据集D,对于数据集中的每一个数据样本 ( S , M , B ) ∈ D (S, M, B) \in D (S,M,B)∈D:其中, S ∈ R w × h S \in \mathbb{R}^{w \times h} S∈Rw×h 代表一幅医学图像, w × h w \times h w×h为每幅图像切片的尺寸; M ∈ C w × h M \in C^{w \times h} M∈Cw×h是语义分割任务的标签(即掩码,Mask), C = { 0 , 1 , … , n } C = \{0, 1, \dots, n\} C={0,1,…,n}代表标签中的类别集合; B ∈ 2 R 4 × C B \in 2^{\mathbb{R}^{4} \times C} B∈2R4×C 是基于M标注得到的目标检测任务标签。对于B中的每个元素 b = ( x c , y c , l w , l h , c ) b = (x_c, y_c, l_w, l_h, c) b=(xc,yc,lw,lh,c): ( x c , y c ) ∈ R 2 (x_c, y_c) \in \mathbb{R}^2 (xc,yc)∈R2 表示由M在每个目标上生成的外接矩形中心点坐标, ( l w , l h ) ∈ R 2 (l_w, l_h) \in \mathbb{R}^2 (lw,lh)∈R2 表示该矩形的尺寸, c ∈ C c \in C c∈C 表示该目标的类别标签。
本研究需进行双任务学习,即利用同一模型同时执行语义分割和目标检测任务,通过两个任务的相互促进,最终提升模型语义分割的精度。
本文提出的 UoloNet 模型包含共享编码器、目标检测模块以及掩码生成模块(即图 1 中的解码器),下文将详细阐述各部分的具体细节。

图1 UoloNet结构
3.2 编码器 - 解码器结构
为更好地体现医学图像中独特的三维关键特征,模型的输入由多幅连续的图像切片 S ∈ R w × h S \in \mathbb{R}^{w \times h} S∈Rw×h构成,最终输入形式为 X ∈ R ( 2 d + 1 ) × w × h X \in \mathbb{R}^{(2d+1) \times w \times h} X∈R(2d+1)×w×h;对多幅连续切片中的第 d + 1 d+1 d+1幅切片,标注其对应的掩码(Mask)和边界框(Box),边缘部分采用镜像扩充的方式处理。在前期研究中已验证,当 d = 2 d = 2 d=2时,模型效果最优。
UoloNet 模型的核心组成部分是共享编码器,该编码器由残差块重复堆叠构成,每个残差块包含两个卷积核大小为 3×3×3 的卷积层。每个卷积层后均进行分组归一化(group normalization)和 ReLU 激活操作。在每次下采样过程中,通过步长为 2 的卷积操作降低输入特征图的分辨率。编码器第一层的特征通道数设为 32,且每完成一次下采样,通道数翻倍,以平衡各层的时间复杂度。编码器共执行 4 次下采样操作,输入为图像X,输出为特征图H。
共享编码器模块主要实现图像的特征提取功能,输出的特征图H同时包含图像的掩码信息和目标识别信息,具备多语义特性,且不受特定任务的限制,这使得目标识别和语义分割任务能够共享同一编码器。与编码器对称的是解码器,解码器通过上采样操作提升特征图的分辨率,同时将特征通道数减半,逐步降低通道数量。
在解码器的每一步处理中,先将上采样后的特征图与编码器对应层级的低层特征图进行融合,再通过残差块对融合后的特征图进行优化。对特征图执行 4 次上采样操作后,得到预分割特征图 M ^ \hat{M} M^: M ^ ∈ R w × h × n \hat{M} \in \mathbb{R}^{w \times h \times n} M^∈Rw×h×n(其中n为类别数,与标签类别数保持一致)。
3.3 目标检测模块
本研究旨在整合目标检测的各个独立组件,构建单一神经网络。该网络利用整幅图像的特征预测每个边界框,同时预测所有目标的边界框,这意味着可对图像中所有目标进行全局范围的网络推理,并与语义分割模块协同工作。YOLO 的架构支持端到端训练,能够实现实时检测速度,同时保持较高的平均精度,为该目标检测模块提供了基础。
3.3.1 目标编码
与 YOLO 的目标编码方式类似,本研究将目标编码为维度为 g × g × ( k × 5 + n ) g \times g \times (k \times 5 + n) g×g×(k×5+n) 的张量,输入模型后计算预测值与真实值的损失。同样,将图像划分为 g × g g \times g g×g的网格,本研究中 g = 7 g = 7 g=7(即 7×7 网格);同时,每个网格区域生成k个边界框,本研究中 k = 2 k = 2 k=2(即每个网格 2 个边界框);n为目标类别数。如图 2 所示,本文实验中的目标类别数为 4,网格数为 7,每个网格的目标框数量 k = 2 k = 2 k=2,因此目标编码后的张量维度为 7 × 7 × ( 2 × 5 + 4 ) = 7 × 7 × 14 7 \times 7 \times (2 \times 5 + 4) = 7 \times 7 \times 14 7×7×(2×5+4)=7×7×14。通过对整幅图像进行特征扩展,得到最终的目标编码结果。
此外,在计算编码过程中的置信度时,本研究采用的方法与传统 IOU(交并比)不同。

图2 编码结构
3.3.2 目标检测头
目标检测头的结构如图 3 所示,由两个卷积块(ConvBlock)、两个线性层(Linear Layer)以及 LeakReLU 激活函数堆叠构成。其中,两个卷积块均包含卷积、池化和 LeakReLU 激活操作;采用两个全连接层(线性层)的设计,是为了避免直接使用单一全连接层对特征图进行扁平化处理(flatten)导致的特征丢失问题。通过上述结构,得到目标检测头的输出结果。

图3:目标检测头(Object detection head)
3.3.3 目标检测中的 CIOU
实验发现,YOLO 算法中使用的 IOU 在目标框与预测框不相交时,无法表示两者之间的距离,导致小目标识别耗时较长。因此,本研究采用 CIOU(完全交并比,Zheng 等人,2020 年)替代 IOU 算法,以提升模型的精度和收敛速度。
CIOU 的计算公式如下:设 b 为标注的真实目标框, b ^ \hat{b} b^ 为模型输出的预测目标框; d i s t ( b ^ , b ) dist(\hat{b}, b) dist(b^,b) 表示 b ^ \hat{b} b^与b中心点之间的欧氏距离; d i a g ( b ^ , b ) diag(\hat{b}, b) diag(b^,b) 表示能够同时包含 b ^ \hat{b} b^ 和b的最小闭合区域的对角线距离。
C I O U ( b ^ , b ) = I O U ( b ^ , b ) − d i s t 2 ( b ^ , b ) d i a g 2 ( b ^ , b ) − p ( b ^ , b ) q ( b ^ , b ) CIOU(\hat{b}, b) = IOU(\hat{b}, b) - \frac{dist^2(\hat{b}, b)}{diag^2(\hat{b}, b)} - p(\hat{b}, b) q(\hat{b}, b) CIOU(b^,b)=IOU(b^,b)−diag2(b^,b)dist2(b^,b)−p(b^,b)q(b^,b)$
3.4 损失函数
3.4.1 语义分割损失
为简化计算,本研究将某一器官及相关肿瘤的分割视为两个双分割任务,采用 DICE 损失与二分类交叉熵(binary cross entropy)相结合的方式,作为每个任务的损失目标。该损失函数的表达式如下:

其中, M ^ [ i , j ] \hat{M}[i, j] M^[i,j] 和 M [ i , j ] M[i, j] M[i,j] 分别表示像素点 ( i , j ) (i, j) (i,j) 的分割预测值和真实标签值;引入 ε \varepsilon ε 作为平滑因子,以避免计算过程中出现分母为 0 的情况。
3.4.2 目标检测损失
与 YOLO V1 网络类似,本模型中每个网格单元可预测多个边界框。为计算正样本的损失,需确定其中一个边界框负责对应目标的预测:具体而言,选择与真实目标框(GT)IOU 最高的边界框作为该目标的负责框。
当某一真实目标的中心点落在某个网格单元内时,该网格单元负责识别该目标;将与真实目标框 IOU 最大的边界框设为正样本,该区域的类别即为真实目标的类别,该边界框的置信度设为 1。除上述被设为正样本的边界框外,其余边界框均为负样本;负样本仅计算置信度损失(无类别损失和边界框位置损失),且置信度的真实值设为 0。模型通过计算预测值与真实目标框(GT)之间的误差来求解损失,采用均方误差(MSE)作为损失计算方式。
该损失函数包含:边界框坐标的定位损失(Localization Loss)、类别损失(Classification Loss)、置信度损失(Confidence Loss)以及边界框的目标存在性损失(Objectness Loss)。
其中, λ c \lambda_c λc 和 λ n \lambda_n λn 分别为无目标时定位损失的权重系数,参考 YOLO 的训练设置,分别取 5 和 0.5。
3.4.3 总损失定义
结合语义分割和目标检测两个任务的损失函数,最终的总损失定义为:
L = L s e g + α L d e t ( 7 ) \mathcal{L} = \mathcal{L}_{seg} + \alpha \mathcal{L}_{det} \quad (7) L=Lseg+αLdet(7)
其中, α = 0.1 \alpha = 0.1 α=0.1 为超参数,用于平衡两个任务损失的权重。
3.5 预测流程
在传统 UNET 模型中,最终的预测结果掩码(mask)会存在大量离散噪声点。在处理大目标分割任务时,这类小噪声点对模型输出结果的影响较小;但在小标签目标的识别与分割任务中,此类假阳性噪声是不可接受的。为解决这一问题,我们提出在预测过程中借助目标检测任务来提升模型性能。其核心目的是利用目标识别结果,告知模型在进行掩码分割时应重点关注哪些特定区域,从而减少离散假阳性噪声,提高分割精度。
预测流程的原理如图 4 所示,下文将详细说明。
体数据(Volume)经模型处理后,会生成两个结果:预分割掩码 M ^ \hat{M} M^ 与目标检测向量 O ∈ R g × g × ( k × 5 + n ) O \in \mathbb{R}^{g \times g \times (k \times 5 + n)} O∈Rg×g×(k×5+n)。每个网格单元中的元素对应一个维度为 k × 5 + n k \times 5 + n k×5+n 的向量。参考 YOLO 算法,首先筛选出置信度(credibility)大于 0.5 的边界框坐标,再通过非极大值抑制(NMS)算法处理,得到最终预测结果:

在计算过程中,将目标检测得到的类别标签扩展为整幅图像尺寸的张量 B ^ ∈ R w × h \hat{B} \in \mathbb{R}^{w \times h} B^∈Rw×h:将边界框(border box)内的像素值设为 1,其余区域像素值设为 0。对目标框的范围 B ^ \hat{B} B^ 与预分割掩码 M ^ \hat{M} M^ 执行哈达玛积(Hadamard operation)运算,得到最终的分割掩码(mask)。
该过程能够消除分割结果中的离散噪声点(separate dots),进一步提升模型预测的精度。本研究定义了目标框范围与掩码(Maks,推测为 Mask 的笔误)预测标签范围的重叠度(Mix):当(Mix > 0.5)时,判定为正重叠(positive superposition);否则为负重叠(negative superposition)。

图4:预测过程
4. 实验
4.1 数据集
本实验所用数据集来源于前期积累的肝脏肿瘤分割数据,由 4 名医学专家使用专业软件完成标注,最终构建成大规模增强肝胆图像(SEHPI)小标签数据集。该数据集采用肝脏特异性造影剂,可对肝脏和胆囊进行动态增强磁共振(MRI)成像;与非肝脏特异性造影剂的磁共振图像不同,肝脏特异性造影剂的肝胆图像有助于肝结节的筛查与诊断,且更易于勾勒病变边界。
在标注过程中,研究人员对肿瘤进行了区分与分类,具体包括肝癌、转移瘤、囊肿和血管瘤四类(如图 5 所示)。该数据集针对肝胆磁共振各相位图像,对常见肝脏疾病进行了分割与分类标注,可辅助医生进行肝脏疾病的诊断工作。数据集中的每幅医学图像切片均为单通道灰度图,像素值范围为 [0,5000],共包含 400 个标注病例。此外,为验证模型泛化性,本实验还将模型与公开数据集 LITS(肝脏肿瘤分割数据集)进行对比;相较于常用的肝脏分割数据集 LITS,本研究构建的 SEHPI 数据集不仅数据量更大、标签划分更精细,还更侧重于肿瘤的分类任务。

4.2 评价指标
设输入数据为X,其对应的真实标签为Y,模型输出结果为 Y ′ Y' Y′,Y与 Y ′ Y' Y′的通道数均为q(即标签类别数)。本实验采用以下指标评估模型性能:
4.2.1 Dice 系数
分割任务的主要评价标准为 Dice 相似系数(Dice Similarity Coefficient, DSC),该系数用于衡量两个样本的集合相似度,通常用于评估分割结果与真实标签的一致性,其中平滑因子 δ = 1 0 − 5 \delta = 10^{-5} δ=10−5,计算公式如下:
D i c e = ∑ m = 1 q 2 Y [ m ] × Y ′ [ m ] + δ Y [ m ] + Y ′ [ m ] + δ Dice = \sum_{m=1}^{q} \frac{2 Y[m] \times Y'[m] + \delta}{Y[m] + Y'[m] + \delta} Dice=m=1∑qY[m]+Y′[m]+δ2Y[m]×Y′[m]+δ
4.2.2 阳性预测值(PPV)
阳性预测值(Positive Predicted Value, PPV)反映分类器或模型对正样本预测的准确性,即预测为正样本的结果中实际为正样本的比例,数值越高表示模型性能越好,计算公式如下:
P P V = ∑ m = 1 q 2 Y [ m ] × Y ′ [ m ] + δ Y ′ [ m ] + δ PPV = \sum_{m=1}^{q} \frac{2 Y[m] \times Y'[m] + \delta}{Y'[m] + \delta} PPV=m=1∑qY′[m]+δ2Y[m]×Y′[m]+δ
4.2.3 灵敏度(Sensitivity)
灵敏度(Sensitivity)反映分类器或模型对真实正样本的检出能力,即能将真实正样本预测为正样本的程度,体现真实正样本中被预测为正样本的比例,数值越高表示模型性能越好,计算公式如下:
S e n s i t i v i t y = ∑ m = 1 q 2 Y [ m ] × Y ′ [ m ] + δ Y [ m ] + δ Sensitivity = \sum_{m=1}^{q} \frac{2 Y[m] \times Y'[m] + \delta}{Y[m] + \delta} Sensitivity=m=1∑qY[m]+δ2Y[m]×Y′[m]+δ
4.2.4 95% 豪斯多夫距离(Hausdorff 95)
Dice 系数对掩码内部填充情况更敏感,而豪斯多夫距离(Hausdorff Distance)则对分割边界的一致性更敏感。设B为真实标签掩码, B ′ B' B′为模型输出掩码, ∥ ⋅ ∥ 2 \|\cdot\|_2 ∥⋅∥2表示b(B中的元素)与 b ′ b' b′( B ′ B' B′中的元素)之间的 L 2 L_2 L2距离,则:
d i s t ( B , B ′ ) = max b ∈ B min b ′ ∈ B ′ ∥ b − b ′ ∥ 2 d H ( B , B ′ ) = max { d i s t ( B , B ′ ) , d i s t ( B ′ , B ) } dist(B, B') = \max_{b \in B} \min_{b' \in B'} \|b - b'\|_2 \\ d_H(B, B') = \max\{dist(B, B'), dist(B', B)\} dist(B,B′)=b∈Bmaxb′∈B′min∥b−b′∥2dH(B,B′)=max{dist(B,B′),dist(B′,B)}
为消除少量离群点的影响,本实验采用 95% 豪斯多夫距离(Hausdorff 95)进行评估,计算公式如下:
d 95 % H D = d H × 95 % ( 14 ) d_{95\% HD} = d_H \times 95\% \quad (14) d95%HD=dH×95%(14)
4.3 训练设置
在训练过程中,从 400 个病例中随机选取 40 个作为测试集,剩余 360 个训练集样本中,40% 被划分为验证集。模型停止训练的条件为:当验证集(VAL)的最佳 Dice 系数连续 20 轮(epoch)未得到提升时,训练终止。由于验证集不参与模型训练,因此可确保模型在达到最佳性能的同时避免过拟合。实验设置批次大小(batch size)为 10,初始学习率为 0.0003,采用随机梯度下降(SGD)算法对模型进行优化。
4.3.1 SEHPI 数据集上的实验
在自建的 SEHPI 数据集上,研究人员设计了四组对比实验,以评估模型在掩码(MASK)分割任务中的性能。在 UoloNet 模型中,最后一层的输出包含四个前景概率图,当前景区域的概率值大于 0.5 时,该区域被判定为分割结果的一部分;经过最终范围确定后,形成最终的分割掩码。本实验的训练设置与 4.3 节一致:400 个病例中 40 个为测试集,训练集的 40% 为验证集;模型停止条件为验证集(val_data)的最佳 Dice 结果连续 20 轮未提升;批次大小为 10,动量(momentum)为 0.9,初始学习率为 0.0003。
详细实验结果如表 1 所示。实验结果表明,UoloNet 模型的性能显著优于其他四种对比模型;尽管在阳性预测值(PPV)和豪斯多夫距离(Hausdorff)两项指标中,UoloNet 并非所有类别均为最优,但与最优结果的差距较小。
此外,不同模型的分割结果可视化如图 7 所示,可直观观察到 UoloNet 的分割效果优势。同时,研究人员还对边界框添加过程进行了可视化(如图 6 所示),结果显示该模型能最大程度避免离散噪声点的产生,从而提升预测精度。具体而言,图 6a 和图 6c 中蓝色箭头所指的离散噪声点,可通过本模型的预测流程被有效消除;而图 6c 中绿色箭头所指的有效区域,则能被模型完整保留。



4.3.2 LITS 数据集上的实验
由于本模型针对小尺度标签设计,因此在与公开数据集 LITS 进行对比时,仅关注肿瘤标签部分的分割结果,使对比更具针对性。不同模型在 LITS 数据集上的性能如表 2 所示,结果表明 UoloNet 在公开数据集上同样表现优异。

4.3.3 CIOU 与 IOU 对比实验
在训练初期,目标损失(target loss)数值较大,易导致训练瓶颈;总损失(total_loss)受目标损失和掩码损失(mask loss)共同影响,因此在训练初期收敛速度较慢,一段时间后会快速下降并最终趋于稳定。观察图 8b 中传统 IOU 模型的收敛曲线可知,该模型在第 130 轮时突破首个训练瓶颈,损失值快速下降,但随后很快进入下一个瓶颈期,并在第 178 轮时再次突破瓶颈,之后模型才逐渐趋于收敛。而采用 CIOU 的模型在第 92 轮时便能快速突破训练瓶颈,且后续未再进入新的瓶颈期,在第 110 轮时目标损失便趋于稳定,收敛效果更优。此外,研究人员还对 CIOU 与 IOU 在实验结果上的影响进行了定量对比,结果如表 3 所示。由表可知,采用 IOU 的模型不仅未达到 CIOU 模型的性能水平,其首次快速收敛轮次(FFCE)也远高于 CIOU 模型,这表明 CIOU 能显著提升模型的收敛速度与预测精度。

4.3.4 超参数选择
在 3.4.3 节总损失计算中提出的超参数 α \alpha α,对模型性能至关重要,它决定了目标识别损失与语义分割损失在总损失中的占比。为确定最优 α \alpha α 值,研究人员设置不同 α \alpha α值进行系列实验,并选取四个标签的 Dice 系数均值与首次快速收敛轮次(FFCE)作为评估指标。实验结果如表 4 所示,当 α = 0.1 \alpha = 0.1 α=0.1时,模型的 Dice 系数均值最高,且收敛速度最快,因此确定$ \alpha = 0.1$为最优超参数。
5. 结论
为解决小尺度标签医学图像分割面临的问题,本研究提出了 UoloNet 模型。该模型采用双任务模式,通过利用目标检测任务的结果,进一步提升了目标分割掩码结果的精度。针对传统 YOLO 结构中的 IOU 模块,研究对其进行了改进,采用 CIOU(完全交并比)替代 IOU(交并比),以提升模型的收敛速度。同时,针对掩码预测过程中产生的噪声,研究提出了一种利用模型生成的目标框进行处理的预测流程,该流程能够解决掩码预测过程中产生的离散点噪声问题,进而进一步提升肿瘤预测结果的质量。实验结果表明,UoloNet 模型在小尺度标签分割任务中表现出优异的性能。
6. 参考文献
Badrinarayanan V, Kendall A, Cipolla R (2017) Segnet: a deep convolutional encoder-decoder architecture for image segmentation. IEEE Trans Pattern Anal Mach Intell 39(12):2481–2495
Chen LC, Papandreou G, Kokkinos I, Murphy K, Yuille AL (2018) Deeplab: semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected CRFS. IEEE Trans Pattern Anal Mach Intell 40(4):834–848
Chen W, Wei H, Peng S, Sun J, Qiao X, Liu B (2019) Hsn: hybrid segmentation network for small cell lung cancer segmentation. IEEE Access 7:75591–75603. https:// doi. org/ 10. 1109/ ACCESS. 2019. 29214 34
Christ P (2017) Lits—liver tumor segmentation challenge (lits17)
Çiçek Ö, Abdulkadir A, Lienkamp SS, Brox T, Ronneberger O (2016) 3d u-net: learning dense volumetric segmentation from sparse annotation. In: International conference on medical image computing and computer-assisted intervention. Springer, New York, pp 424–432
Defferrard M, Bresson X, Vandergheynst P (2016) Convolutional neural networks on graphs with fast localized spectral filtering
Fang Y, Chen C, Yuan Y, Tong KY (2019) Selective feature aggregation network with area-boundary constraints for polyp segmentation. In: Medical image computing and computer assisted intervention–MICCAI 2019: 22nd international conference, Shenzhen, China, October 13–17, 2019, Proceedings, Part I 22, Springer, New York, pp 302–310
Girshick R (2015) Fast r-cnn. In: Proceedings of the ieee international conference on computer vision (ICCV)
Girshick R, Donahue J, Darrell T, Malik J (2014) Rich feature hierarchies for accurate object detection and semantic segmentation. In: Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), pp 580–587
He K, Gkioxari G, Dollár P, Girshick R (2017a) Mask r-cnn. IEEE Trans Pattern Anal Mach Intell
He K, Gkioxari G, Dollar P, Girshick R (2017b) Mask r-cnn. In: Proceedings of the IEEE international conference on computer vision (ICCV)
Huang H, Lin L, Tong R, Hu H, Zhang, Q, Iwamoto Y, Han X, Chen,YW, Wu, J (2020) Unet 3+: a fullscale connected unet for medical image segmentation. In: ICASSP 2020-2020 IEEE international
conference on acoustics, speech and signal processing (ICASSP), pp 1055–1059. IEEE Isensee F, Jaeger PF, Kohl SA, Petersen J, Maier-Hein KH (2021) nnu-net: a self-configuring method for deep learning-based biomedical image segmentation. Nat Methods 18(2):203–211
Korez R, Likar B, Pernu F, Vrtovec T (2016) Model-based segmentation of vertebral bodies from MR images with 3d CNNS. In: International conference on medical image computing and computerassisted intervention
Liu W, Anguelov D, Erhan D, Szegedy C, Reed S, Fu CY, Berg AC (2015) Ssd: single shot multibox detector
Liu Y, Duan Y, Zeng T (2022) Learning multi-level structural information for small organ segmentation. Signal Process 193:108418. https:// doi. org/ 10. 1016/j. sigpro. 2021. 108418
Long J, Shelhamer E, Darrell T (2015) Fully convolutional networks for semantic segmentation. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 3431–3440
Lou A, Guan S, Ko H, Loew M (2022) CaraNet: context axial reverse attention network for segmentation of small medical objects
Milletari F, Navab N, Ahmadi SA (2016) V-net: fully convolutional neural networks for volumetric medical image segmentation. In: 2016 fourth international conference on 3D vision (3DV), pp 565–571. IEEE Ngo DK, Tran MT, Kim SH, Yang HJ, Lee GS (2020) Multi-task learning for small brain tumor segmentation from MRI. Appl Sci 10(21):7790
Noh H, Hong S, Han B (2015) Learning deconvolution network for semantic segmentation. In: Proceedings of the IEEE international conference on computer vision (ICCV)
Plastiras G, Kyrkou C, Theocharides T (2019) Edgenet: balancing accuracy and performance for edgebased convolutional neural network object detectors. In: International conference on distributed smart cameras
Qian Y, Dolan JM, Yang M (2019) Dlt-net: joint detection of drivable areas, lane lines, and traffic objects. IEEE Trans Intell Transp Syst 21(11):4670–4679
Redmon J, Farhadi A (2017) Yolo9000: better, faster, stronger. In: IEEE, pp 6517–6525
Redmon J, Divvala S, Girshick R, Farhadi A (2016) You only look once: unified, real-time object detection. In: Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR) Ren S, He K, Girshick R, Sun J (2015a) Faster r-cnn: towards real-time object detection with region proposal networks. Adv Neural Inf Process Syst 28:91–99
Ren S, He K, Girshick R, Sun J (2015b) Faster r-cnn: towards real-time object detection with region proposal networks. In: Cortes C, Lawrence N, Lee D, Sugiyama M, Garnett R (eds) Advances in neural information processing systems, vol 28. Curran Associates Inc, New York Rfa B, Fga C (2019) Towards an efficient segmentation of small rodents brain: a short critical review. J Neurosci Methods 323:82–89
Ronneberger O, Fischer P, Brox T (2015) U-net: convolutional networks for biomedical image segmentation. In: International conference on medical image computing and computer-assisted intervention Shafiee MJ, Chywl B, Li F, Wong A (2017) Fast yolo: a fast you only look once system for real-time embedded object detection in video. J Comput Vis Imaging Syst 3(1)
Wang X, Shrivastava A, Gupta A (2017) A-fast-rcnn: hard positive generation via adversary for object detection. In: 2017 IEEE conference on computer vision and pattern recognition (CVPR)
Xu Z, Wu Z, Feng J (2018) Cfun: combining faster r-cnn and u-net network for efficient whole heart segmentation
Yi J, Wu P, Metaxas DN (2019) Assd: attentive single shot multibox detector. Comput Vis Image Underst 189:102827. https:// doi. org/ 10. 1016/j. cviu. 2019. 102827
Zhao H, Shi J, Qi X, Wang X, Jia J (2016) Pyramid scene parsing network. In: IEEE computer society Zheng Z, Wang P, Ren D, Liu W, Ye R, Hu Q, Zuo W (2020) Enhancing geometric factors in model learning and inference for object detection and instance segmentation
Zhou Z, Siddiquee MMR, Tajbakhsh N, Liang J (2018) Unet++: a nested u-net architecture for medical image segmentation. In: Deep learning in medical image analysis and multimodal learning for clinical decision support. Springer, New York, pp 3–11
引用说明: Zhang, K., Zhang, L. & Pan, H. UoloNet: based on multi-tasking enhanced small target medical segmentation model. Artif Intell Rev 57, 31 (2024). https://doi.org/10.1007/s10462-023-10671-5
版权说明:
youcans@xidian 作品,转载必须标注原文链接:
【医学影像 AI】UoloNet:基于多任务增强的小目标医学分割模型(https://youcans.blog.csdn.net/article/details/154240960)
Crated:2025-11
更多推荐

所有评论(0)