医学论文解读:Calibrating Label Distribution for Class-Imbalanced Barely-Supervised Knee Segmentation
会议:MICCAI
年份:2022
英文名字:Calibrating Label Distribution for Class-Imbalanced Barely-Supervised Knee Segmentation
中文译为:面向类别不平衡极少标注膝关节分割的标签分布校准方法
一、摘要
膝关节 3D MRI 分割对于骨关节炎(Osteoarthritis,OA)的定量分析具有重要意义,但医学影像的体素级标注需要专业医生完成,成本非常高,因此作者研究的是极少标注条件下的半监督膝关节分割。
这项任务还有一个非常严重的问题:类别不平衡。膝关节 MRI 中,前景区域本身只占整个体积的一小部分,而软骨又非常薄。作者统计发现,软骨仅占前景体素的大约 6%,因此在只有极少量标注数据时,网络非常容易偏向骨组织,而忽略股骨软骨和胫骨软骨。
为此,作者提出CLD 半监督分割框架,利用标签的两种分布信息:
- 标签数量分布:不同类别有多少体素;
- 标签位置分布:软骨主要出现在 MRI 体积的哪些空间区域。
在此基础上,设计了三个核心模块:
Class-Aware Weighted Loss + Probability-Aware Random Cropping + Dual Uncertainty-Aware Sampling Supervision。
所以整篇文章实际上是在做:
- 数量不平衡 → Loss 校准
- 空间不平衡 → Crop 校准
- 置信度不平衡 → Supervision 校准
最终实验表明,该方法在只有1% 标注数据的情况下显著优于多个主流半监督分割方法,并有效改善了软骨等少数类别的分割性能。
二、创新点
创新点 1:首次针对极少标注膝关节分割中的类别不平衡问题进行专门设计
以前很多半监督医学图像分割方法主要解决:
“标注数据太少怎么办?”
而这篇论文进一步指出:
标注少并不是唯一问题,标注少 + 类别不平衡才是膝关节 MRI 更严重的问题。
例如骨组织体积大,而软骨极薄,如果直接使用普通 CPS 等半监督方法,伪标签和损失都会逐渐偏向大类别。
因此作者没有单纯设计新的伪标签机制,而是从标签分布校准的角度解决问题。
创新点 2:同时利用“标签数量分布”和“标签空间分布”
作者没有只做传统的 class weighting,而是把标签统计信息拆成了两类:
- 数量分布 → 调整 Loss;
- 位置分布 → 调整 Crop。
也就是说:
哪个类别少,就增加它在损失中的权重;
哪个区域更容易包含软骨,就增加这个位置被裁剪出来训练的概率。
这样从损失函数和数据采样两个层面同时改善类别不平衡。
创新点 3:利用类别不确定性动态调整伪标签监督
作者进一步发现:软骨不仅数量少,而且模型对软骨的预测置信度也更低。
因此设计Dual Uncertainty-Aware Sampling Supervision(DUS):
模型越不确定的类别 → 采样更多体素参与训练;
模型越确定的类别 → 采样相对减少。
并且由于 CPS 中有两个模型,因此作者分别维护两个uncertainty bank,动态更新每个类别的不确定性。
三、方法
所提出的半监督分割框架概述:利用分割标签的数量分布将原始的监督/无监督损失修改为加权形式。通过结合软骨的位置分布(右),用概率感知的裁剪策略代替随机裁剪。此外,我们设计了双重不确定性感知采样,以增强对低置信度类别的监督,从而实现高效的无监督学习。
3.1 Cross Pseudo Supervision 半监督基础框架
作者并没有重新设计一个全新的分割网络,而是采用 **CPS(Cross Pseudo Supervision)**作为半监督基础框架。
系统包含两个结构相同、参数初始化不同的模型:Model A(θA),Model B(θB),两者都使用V-Net作为 backbone。
对于有标签数据,两边都通过真实标签计算监督损失。
对于无标签数据:
- Model A 的预测作为 Model B 的伪标签;
- Model B 的预测作为 Model A 的伪标签。
因此两个网络互相监督。总体损失可以理解为:
其中监督损失采用:Cross-Entropy + Soft Dice Loss
而无监督损失采用 Cross-Entropy,通过两个模型的交叉伪标签实现一致性监督。
3.2 校准标签分布(Calibrating Label Distribution (CLD))
为了解决几乎不受监督的膝关节分割中的类不平衡问题,提出了一种新的框架CLD,通过利用软软骨和硬组织的标签分布来解决类不平衡的问题。
3.2.1 Class-Aware Weighted Loss:类别感知加权损失
第一个核心模块解决的是:
软骨体素太少。
作者首先统计每一个类别的体素数量,然后根据类别比例计算对应的类别权重。
基本原则非常简单: 类别越少⇒权重越大
例如:
- 股骨、胫骨体积很大 → 权重较小;
- 股骨软骨、胫骨软骨体积很小 → 权重较大。
之后无论是真实标签监督还是伪标签监督,对不同类别的 loss 都采用不同权重。
因此网络训练时不会因为骨组织体素很多,就把大部分优化能力放在骨组织上。
3.2.2 Probability-Aware Random Cropping:概率感知裁剪
这个模块针对的是一个非常容易被忽略的问题:
即使进行了类别加权,如果训练时根本没有 Crop 到软骨,加权也没有意义。
3D MRI 一般不会直接把完整 Volume 输入网络,而是随机裁剪成小的 sub-volume。
但是软骨非常薄,在 z 轴上出现的范围比较小。
因此普通 Random Crop: P(z)=constant会导致大量训练 patch 根本没有软骨。
作者于是利用少量有标签数据统计软骨在z 轴方向的空间位置分布,生成一个cropping probability mask。
如果某个 z 位置经常出现软骨: P(z)↑,训练时就在这里多 Crop。
论文中将满足条件区域的裁剪概率提高了β=2.0 倍。
因此可以理解成:Random Crop变成:Cartilage-Aware Crop
从而让网络在训练过程中看到更多软骨样本。
3.2.3 Dual Uncertainty-Aware Sampling Supervision
第三个模块解决的是:
不同类别的预测难度不同。
作者发现由于类别不平衡: U>Ubone,即模型对软骨更加不确定。
因此作者为每一个类别计算预测不确定性:
直观上就是:
如果模型在该类别真实区域内预测概率很低,那么这个类别的不确定性就很高。
为了保证稳定性,作者不是根据一个 batch 计算,而是累计多个 sub-volume,并采用EMA更新 uncertainty bank。
然后根据:
计算每个类别的采样率。
因此:
- 高不确定性类别 → 多采样 → 多监督
- 低不确定性类别 → 少采样
因为 CPS 有两个模型,所以分别维护: UA,UB
这就是为什么称为Dual Uncertainty-Aware Sampling。
四、实验
4.1 数据集
作者使用的是来自Osteoarthritis Initiative(OAI)的膝关节 MRI。
共:512 个 3D MRI scans
划分为:
- 训练集:412
- 验证集:50
- 测试集:50
图像尺寸为:384×384×160
包含四个前景类别:
- DF:Distal Femur,股骨远端
- FC:Femoral Cartilage,股骨软骨
- Ti:Tibia,胫骨
- TC:Tibial Cartilage,胫骨软骨
标注由骨科医生完成。
其中真正用于半监督实验的标注数据非常少:
4 个有标签 MRI + 408 个无标签 MRI
也就是只有: 1% labeled data
4.2 结果
作者比较了:
- V-Net
- UA-MT
- URPC
- CPS
- CPS + AEL
- CLD
相比基础 CPS:83.4%→87.2%
平均 Dice 提升: +3.8%
更加重要的是软骨。
- 股骨软骨 FC: 81.1%→83.7%,提升2.6%。
- 胫骨软骨 TC: 67.7%→78.6%,提升10.9%
说明它确实主要改善了少数类别,而不是单纯提高整体 Dice。
五、结论
论文最终提出了一套针对极少标注、类别高度不平衡的膝关节 MRI 半监督分割框架 CLD。
其中:
- Class-Aware Weighted Loss利用标签数量分布解决类别数量不平衡;
- Probability-Aware Random Cropping利用标签空间位置分布,让训练更多看到软骨;
- Dual Uncertainty-Aware Sampling利用类别预测不确定性,让模型更多学习困难类别。
作者特别指出,WL 和 DUS 是相对通用的类别不平衡半监督学习策略,而 PRC 更具有膝关节任务特异性,因为膝关节软骨在 z 轴上非常薄,从而天然具有较低的随机裁剪概率。
