当前位置: 首页 > news >正文

无偏教师 v2:适用于无锚框和基于锚框检测器的半监督目标检测

一、论文信息

  1. 论文题目:Unbiased Teacher v2: Semi-supervised Object Detection for Anchor-free and Anchor-based Detectors
  2. 论文作者:Yen-Cheng Liu, Chih-Yao Ma, Zsolt Kira
  3. 发表单位:Georgia Institute of Technology, Meta
  4. 发表期刊:CVPR2022

二、研究背景

  1. 缺少针对无锚框检测器的半监督目标检测方案:现有半监督目标检测相关研究主要聚焦于基于锚框的检测器,直接迁移到无锚框检测器,性能提升很差。根源是半监督场景下,中心度得分不可靠、基于定位的标签分配对伪标签中的定位噪声缺乏鲁棒性。
  2. 伪标签做边界框回归效果差:传统教师-学生框架依靠置信度阈值筛选伪框做回归损失。
  • 单一分数无法表达框四条边界各自的定位质量;
  • 分类置信度不能准确反映边界回归预测质量;
  • 仅依靠教师置信度来选择伪标签,无法过滤会误导回归训练的错误样本。

三、本文创新点

  1. 探究无锚框检测器半监督问题:首次实证研究半监督方法在无锚框检测器上的表现,识别出中心度、标签分配带来的核心问题,实现半监督方法在无锚框、基于锚框两类检测器上通用。
  2. 提出用于无监督回归损失的聆听学生Listen2Student机制:新增边界定位不确定性分支,对比师生模型的相对不确定性,有助于在半监督设计下对回归分支实现正向改进。
  3. Unbiased Teacher v2 通用半监督检测框架:一套框架同时兼容锚框、无锚框检测器,弥补了半监督场景下两种检测器的性能差距。

四、具体方法

4.1 背景

  1. Ds={xis,yis}i=1Ns D_s=\{x_i^s,y_i^s\}_{i=1}^{N_s}Ds={xis,yis}i=1Ns
    代表有标签数据集,包含图像与对应的真实标注,一共NsN_sNs
  2. Du={xiu}i=1Nu D_u=\{x_i^u\}_{i=1}^{N_u}Du={xiu}i=1Nu
    代表无标签数据集,仅有图像X_i,没有人工标注,一共NuN_uNu

现有研究包含两个阶段:预热阶段和相互学习阶段。
3. 监督损失,在有标签数据集上计算
Lsup=∑iL(xis,yis). L_{sup}=\sum_{i} L(x_i^s,y_i^s).Lsup=iL(xis,yis).
遍历所有有标签样本,对单张有标签图像的检测损失求和。L内部就是检测器原生损失,包括分类损失+边框回归损失
4. 无监督损失,在无标注数据集上计算
Lunsup=∑iL(xiu,y^iu). L_{unsup}=\sum_{i} L(x_i^u,\hat{y}_i^u).Lunsup=iL(xiu,y^iu).
L(.):检测器损失函数(分类+回归)

4.2 无锚框检测器上的伪标签学习

  1. FCOS模型包含三个主要预测分支:
  • 用于执行目标类别分类的分类器
  • 用于指示成为前景目标中心概率的中心性分支
  • 用于估计到目标边界距离的回归器

    发现:半监督目标检测中,无锚框检测器收益远不如锚框检测器
    全监督条件下:无锚框检测效果更好;但是半监督条件下,这几个方法均有明显下降。

    把UT适配到无锚框模型:直接迁移后性能下降
    F-RCNN:有锚框
    FCOS:无锚框
    全监督情况下,无锚框能力略好于有锚框;标注比例越少,无锚框的mAP明显下降。说明传统伪标签方案在无锚框检测器上存在缺陷。
  1. 中心偏差度问题

    FCOS打分逻辑:Box Score=分类得分*中心度
    中心度:无锚框特有,衡量采样点距离物体真实框中心有多远,0~1,用于惩罚定位不准的预测

    训练迭代-mAP曲线
    红色:FCOS做法;
    蓝色:只用分类得分筛选伪标签。
    说明中心度在半监督场景起到负面作用。

    迭代次数-平均分数曲线
    中心度:持续增大
    分类得分:随着迭代次数增多,分类得分反而逐步下降
    Box-Score:缓慢下降
    说明:中心度分支由于无标注数据,输出值普遍很高;但是分类分支在下降,最终很多分类很差的框,由于中心度很大,最终也会被选为伪标签,导致低质量伪标签持续输入训练,也造成了(a)图后期的下降。
  2. 不可靠的标签分配
    为提升全监督无锚框检测器的性能,有两类高级标签分配策略:
  • 基于边界框定位加权的软分类标签,这类标签会根据边界框的定位情况进行加权
  • FCOS的center-sampling中心采样:只把距离物体中心足够近的像素记为前景,框边缘像素视为背景,在全监督场景下效果很好

    Pseudo‑box 伪标签框,伪标签框本身已经偏移,存在定位噪声
    • Pseudo‑box伪标签框整体偏移,算法直接把背景标记为前景,精确率、召回率均为零
    • Localization‑based Class. Label(基于定位的软标签)距离伪框中心越近,前景权重越高,算法将权重最高区域落在了背景,只有极少像素在真实物体上
    • Standard(基础标准分配)把整个伪框内全部像素标记为前景,不做筛选,此方法精确率召回率均高于另两种策略
    • 原因:中心采样过分依赖框的中心准确度,伪框中心一旦不准,就会有大量标签分配出现问题
  1. 解决方法
  • 只使用分类得分筛选伪框,舍弃中心度分数
  • 分类器使用硬标签进行训练,不再使用依靠框定位加权得到的软标签
  • 使用标准标签分配策略
  1. 依旧没有解决伪框存在定位噪声的问题,所以又提出了聆听学生板块

4.3 用于无监督回归损失的Listen2Student

4.3.1 回归任务中置信度阈值化的局限性

置信度阈值筛选伪框在回归任务中依旧存在固有局限。虽然置信度阈值在分类任务中表现良好,但无法有效过滤框回归中的误导性样本,原因有:

  • 常规检测器的回归分支只输出边界坐标,没有预测定位不确定性;分类置信度无法反映框定位质量
  • 单一分数(中心度/交并比分数)难以同时表示四个边界各自的预测质量
  • 回归输出为无界连续数值,高置信度的教师模型依然可能输出误导性样本
4.3.2聆听学生板块

  1. 理想情况下的定义(有真实GT时)
    d~t\tilde{d}_td~t:教师回归预测
    dgd_gdg:真实回归标签(GT)
    d~s\tilde{d}_sd~s:学生回归预测
  • 有益样本:∥d~t−dg∥≤∥d~s−dg∥\|\tilde{d}_t-d_g\| \le \|\tilde{d}_s-d_g\|d~tdgd~sdg
    教师预测比学生更准:用教师结果监督学生
  • 误导样本:∥d~t−dg∥>∥d~s−dg∥\|\tilde{d}_t-d_g\| > \|\tilde{d}_s-d_g\|d~tdg>d~sdg
    学生预测更准:不使用教师生成的伪标签
  • 但是半监督无标签数据没有真实标签,所以新增分支定位不确定性分支,用不确定性近似预测和GT的误差
  1. 定位不确定性分支
    把边界回归看成高斯分布:
    p(d∣x)=N(d; d^, δ2)p(d|x) = \mathcal{N}(d;\ \hat{d},\ \delta^2)p(dx)=N(d;d^,δ2)
    d^\ \hat{d}d^:回归分支预测的边界距离(均值)
    δ\ \deltaδ:不确定性分支输出的标准差,越大说明模型对这个边界预测越没把握
  • 有监督损失:NPLL负幂对数似然损失
    Lregsup=∑iηi(∑((ds−dg)22δs2+12log⁡δs2)+2log⁡2π)\mathcal{L}_{reg}^{sup} = \sum_{i} \eta_i\left(\sum\left(\frac{(d_s-d_g)^2}{2\delta_s^2}+\frac12\log\delta_s^2\right)+2\log2\pi\right)Lregsup=iηi((2δs2(dsdg)2+21logδs2)+2log2π)

    • dgd_gdg:GT真实边界距离
    • dsd_sds:学生网络回归分支预测边界距离
    • δs\delta_sδs:学生不确定性分支输出的不确定性(标准差)
    • ηi\eta_iηi:预测框和真值框的交并比权重;交并比越高,该样本损失权重越大
    • ∑((ds−dg)22δs2)\sum\left(\frac{(d_s-d_g)^2}{2\delta_s^2}\right)(2δs2(dsdg)2):回归误差项,如果预测错了,不确定性要变大,以承担误差
    • 12log⁡δs2\frac12\log\delta_s^221logδs2:正则项,防止不确定性无限变大
  • 无监督回归损失:利用师生不确定性做伪标签筛选
    Lregunsup={∑i∥d~ti−d~si∥,if δti+σ≤δsi0,otherwise\mathcal{L}_{reg}^{unsup}= \begin{cases} \sum_i \|\tilde{d}_t^i-\tilde{d}_s^i\|, & \text{if } \delta_t^i+\sigma \le \delta_s^i \\ 0, & \text{otherwise} \end{cases}Lregunsup={id~tid~si,0,ifδti+σδsiotherwise
    训练阶段:只有在教师不确定性显著小于学生时,才添加无监督回归损失
    推理阶段:直接丢弃不确定性分支,只保留回归分支

http://www.cnnetsun.cn/news/4212091.html

相关文章:

  • Agent 敢开写权限吗?—— 深入探讨 AI 代理的自主操作风险与安全边界
  • C++初阶——类和对象(下)
  • AI 编程不得不知道的二三事
  • 隐匿中的生长:当代青年 “偷感” 现象解读
  • 2021CSP-J初赛真题解析(适合复习、巩固、备考)
  • 麒麟(Kylin)服务器系统网卡地址设置
  • 女孩子可以考什么证书比较简单
  • Ansible实战:LNMP一键部署指南
  • 汉森制药(002412)深度研究报告
  • 理解 JWT:三段分别是什么
  • 计算机毕业设计之企业社交网络平台的设计与实现
  • HarmonyOS 性能优化工具链:从「手工排查」到「工程化治理」的全栈实战指南
  • 01-具身机器人硬件全景拆解
  • ABAP 里有没有 AI Agent 的 Progressive Disclosure,一套从封装、Released API 到 RAP 暴露层的完整对照
  • 从奈奎斯特判据到无源性:为什么只需保证逆变器导纳无源就能稳定并网?
  • 【python】条件语句
  • 【2015-03-02】《RealView编译工具汇编器指南》摘录:内置变量和常数
  • 手机玩鸣潮 3.6 版本,随时随地开荒新地图不卡顿
  • AIGC 到底是什么:从传统软件到生成式人工智能
  • 规模化养殖冰爽强甘多少钱
  • Go单例模式:sync.Once与双重检查
  • 【第9篇】 EfficientViT(ICCV 2023):基于多尺度线性注意力的高效高分辨率密集预测网络
  • 封神了!Scrapling 火了,AI 时代的数据采集神器来了
  • 经验丰富的杭州园林景观工程公司排名哪个好
  • DC/DC电源怎么选?如何在效率、体积、隔离和EMI之间做平衡?
  • 【代码评测】AI 写代码更快以后,为什么 Review 反而成为瓶颈?
  • 大宗交易折溢价因子怎么挖掘本地化Python全流程实战 IG50免费开源股票数据API接口
  • SRC挖洞变现:业务逻辑漏洞报告怎么写才能评上高危?(附5类报告模板)
  • Claude Code文档访问失败?开发者必备的版本管理与信息同步方案
  • 2026年家长必看!靠谱儿童视光及近视防控该如何选择?