无偏教师 v2:适用于无锚框和基于锚框检测器的半监督目标检测
一、论文信息
- 论文题目:Unbiased Teacher v2: Semi-supervised Object Detection for Anchor-free and Anchor-based Detectors
- 论文作者:Yen-Cheng Liu, Chih-Yao Ma, Zsolt Kira
- 发表单位:Georgia Institute of Technology, Meta
- 发表期刊:CVPR2022
二、研究背景
- 缺少针对无锚框检测器的半监督目标检测方案:现有半监督目标检测相关研究主要聚焦于基于锚框的检测器,直接迁移到无锚框检测器,性能提升很差。根源是半监督场景下,中心度得分不可靠、基于定位的标签分配对伪标签中的定位噪声缺乏鲁棒性。
- 伪标签做边界框回归效果差:传统教师-学生框架依靠置信度阈值筛选伪框做回归损失。
- 单一分数无法表达框四条边界各自的定位质量;
- 分类置信度不能准确反映边界回归预测质量;
- 仅依靠教师置信度来选择伪标签,无法过滤会误导回归训练的错误样本。
三、本文创新点
- 探究无锚框检测器半监督问题:首次实证研究半监督方法在无锚框检测器上的表现,识别出中心度、标签分配带来的核心问题,实现半监督方法在无锚框、基于锚框两类检测器上通用。
- 提出用于无监督回归损失的聆听学生Listen2Student机制:新增边界定位不确定性分支,对比师生模型的相对不确定性,有助于在半监督设计下对回归分支实现正向改进。
- Unbiased Teacher v2 通用半监督检测框架:一套框架同时兼容锚框、无锚框检测器,弥补了半监督场景下两种检测器的性能差距。
四、具体方法
4.1 背景
- Ds={xis,yis}i=1Ns D_s=\{x_i^s,y_i^s\}_{i=1}^{N_s}Ds={xis,yis}i=1Ns
代表有标签数据集,包含图像与对应的真实标注,一共NsN_sNs张 - Du={xiu}i=1Nu D_u=\{x_i^u\}_{i=1}^{N_u}Du={xiu}i=1Nu
代表无标签数据集,仅有图像X_i,没有人工标注,一共NuN_uNu张
现有研究包含两个阶段:预热阶段和相互学习阶段。
3. 监督损失,在有标签数据集上计算
Lsup=∑iL(xis,yis). L_{sup}=\sum_{i} L(x_i^s,y_i^s).Lsup=i∑L(xis,yis).
遍历所有有标签样本,对单张有标签图像的检测损失求和。L内部就是检测器原生损失,包括分类损失+边框回归损失
4. 无监督损失,在无标注数据集上计算
Lunsup=∑iL(xiu,y^iu). L_{unsup}=\sum_{i} L(x_i^u,\hat{y}_i^u).Lunsup=i∑L(xiu,y^iu).
L(.):检测器损失函数(分类+回归)
4.2 无锚框检测器上的伪标签学习
- FCOS模型包含三个主要预测分支:
- 用于执行目标类别分类的分类器
- 用于指示成为前景目标中心概率的中心性分支
- 用于估计到目标边界距离的回归器
发现:半监督目标检测中,无锚框检测器收益远不如锚框检测器
全监督条件下:无锚框检测效果更好;但是半监督条件下,这几个方法均有明显下降。
把UT适配到无锚框模型:直接迁移后性能下降
F-RCNN:有锚框
FCOS:无锚框
全监督情况下,无锚框能力略好于有锚框;标注比例越少,无锚框的mAP明显下降。说明传统伪标签方案在无锚框检测器上存在缺陷。
- 中心偏差度问题
FCOS打分逻辑:Box Score=分类得分*中心度
中心度:无锚框特有,衡量采样点距离物体真实框中心有多远,0~1,用于惩罚定位不准的预测
训练迭代-mAP曲线
红色:FCOS做法;
蓝色:只用分类得分筛选伪标签。
说明中心度在半监督场景起到负面作用。
迭代次数-平均分数曲线
中心度:持续增大
分类得分:随着迭代次数增多,分类得分反而逐步下降
Box-Score:缓慢下降
说明:中心度分支由于无标注数据,输出值普遍很高;但是分类分支在下降,最终很多分类很差的框,由于中心度很大,最终也会被选为伪标签,导致低质量伪标签持续输入训练,也造成了(a)图后期的下降。 - 不可靠的标签分配
为提升全监督无锚框检测器的性能,有两类高级标签分配策略:
- 基于边界框定位加权的软分类标签,这类标签会根据边界框的定位情况进行加权
- FCOS的center-sampling中心采样:只把距离物体中心足够近的像素记为前景,框边缘像素视为背景,在全监督场景下效果很好
Pseudo‑box 伪标签框,伪标签框本身已经偏移,存在定位噪声- Pseudo‑box伪标签框整体偏移,算法直接把背景标记为前景,精确率、召回率均为零
- Localization‑based Class. Label(基于定位的软标签)距离伪框中心越近,前景权重越高,算法将权重最高区域落在了背景,只有极少像素在真实物体上
- Standard(基础标准分配)把整个伪框内全部像素标记为前景,不做筛选,此方法精确率召回率均高于另两种策略
- 原因:中心采样过分依赖框的中心准确度,伪框中心一旦不准,就会有大量标签分配出现问题
- 解决方法
- 只使用分类得分筛选伪框,舍弃中心度分数
- 分类器使用硬标签进行训练,不再使用依靠框定位加权得到的软标签
- 使用标准标签分配策略
- 依旧没有解决伪框存在定位噪声的问题,所以又提出了聆听学生板块
4.3 用于无监督回归损失的Listen2Student
4.3.1 回归任务中置信度阈值化的局限性
置信度阈值筛选伪框在回归任务中依旧存在固有局限。虽然置信度阈值在分类任务中表现良好,但无法有效过滤框回归中的误导性样本,原因有:
- 常规检测器的回归分支只输出边界坐标,没有预测定位不确定性;分类置信度无法反映框定位质量
- 单一分数(中心度/交并比分数)难以同时表示四个边界各自的预测质量
- 回归输出为无界连续数值,高置信度的教师模型依然可能输出误导性样本
4.3.2聆听学生板块
- 理想情况下的定义(有真实GT时)
d~t\tilde{d}_td~t:教师回归预测
dgd_gdg:真实回归标签(GT)
d~s\tilde{d}_sd~s:学生回归预测
- 有益样本:∥d~t−dg∥≤∥d~s−dg∥\|\tilde{d}_t-d_g\| \le \|\tilde{d}_s-d_g\|∥d~t−dg∥≤∥d~s−dg∥
教师预测比学生更准:用教师结果监督学生 - 误导样本:∥d~t−dg∥>∥d~s−dg∥\|\tilde{d}_t-d_g\| > \|\tilde{d}_s-d_g\|∥d~t−dg∥>∥d~s−dg∥
学生预测更准:不使用教师生成的伪标签 - 但是半监督无标签数据没有真实标签,所以新增分支定位不确定性分支,用不确定性近似预测和GT的误差
- 定位不确定性分支
把边界回归看成高斯分布:
p(d∣x)=N(d; d^, δ2)p(d|x) = \mathcal{N}(d;\ \hat{d},\ \delta^2)p(d∣x)=N(d;d^,δ2)
d^\ \hat{d}d^:回归分支预测的边界距离(均值)
δ\ \deltaδ:不确定性分支输出的标准差,越大说明模型对这个边界预测越没把握
有监督损失:NPLL负幂对数似然损失
Lregsup=∑iηi(∑((ds−dg)22δs2+12logδs2)+2log2π)\mathcal{L}_{reg}^{sup} = \sum_{i} \eta_i\left(\sum\left(\frac{(d_s-d_g)^2}{2\delta_s^2}+\frac12\log\delta_s^2\right)+2\log2\pi\right)Lregsup=i∑ηi(∑(2δs2(ds−dg)2+21logδs2)+2log2π)- dgd_gdg:GT真实边界距离
- dsd_sds:学生网络回归分支预测边界距离
- δs\delta_sδs:学生不确定性分支输出的不确定性(标准差)
- ηi\eta_iηi:预测框和真值框的交并比权重;交并比越高,该样本损失权重越大
- ∑((ds−dg)22δs2)\sum\left(\frac{(d_s-d_g)^2}{2\delta_s^2}\right)∑(2δs2(ds−dg)2):回归误差项,如果预测错了,不确定性要变大,以承担误差
- 12logδs2\frac12\log\delta_s^221logδs2:正则项,防止不确定性无限变大
无监督回归损失:利用师生不确定性做伪标签筛选
Lregunsup={∑i∥d~ti−d~si∥,if δti+σ≤δsi0,otherwise\mathcal{L}_{reg}^{unsup}= \begin{cases} \sum_i \|\tilde{d}_t^i-\tilde{d}_s^i\|, & \text{if } \delta_t^i+\sigma \le \delta_s^i \\ 0, & \text{otherwise} \end{cases}Lregunsup={∑i∥d~ti−d~si∥,0,ifδti+σ≤δsiotherwise
训练阶段:只有在教师不确定性显著小于学生时,才添加无监督回归损失
推理阶段:直接丢弃不确定性分支,只保留回归分支
