当前位置: 首页 > news >正文

CenterPoint — Center-based 3D Object Detection and Tracking论文精读

一、论文基本信息

项目内容
标题Center-based 3D Object Detection and Tracking
作者Tianwei Yin, Xingyi Zhou, Philipp Krähenbühl
单位UT Austin
发表arXiv 2020(NeurIPS 2020 nuScenes挑战赛 Top 4中3个方案采用)
代码https://github.com/tianweiy/CenterPoint
关键词3D目标检测、3D目标跟踪、中心点表示、点云、自动驾驶

二、研究动机与核心思想

2.1 核心问题

3D世界中的物体不遵循任何特定朝向,而基于框(anchor)的检测器难以枚举所有朝向,也难以用轴对齐框去拟合旋转物体。

2.2 Anchor-based方法的困境

问题说明
朝向枚举困难需要为每个朝向设置不同anchor模板,计算负担大
轴对齐框不适配3D旋转框无法用2D轴对齐框良好近似
IoU阈值敏感训练依赖2D Box IoU进行正负样本分配,不同类别/数据集需不同阈值
转弯场景失效车辆左转时,anchor-based方法难以检测旋转物体(见Figure 1)

2.3 核心洞察

将3D物体表示为"点"(中心点),而非"框"。

  • 点没有内在朝向 → 大幅减少搜索空间
  • 点表示天然旋转不变 → backbone学习旋转等变性
  • 点表示简化跟踪 → 轨迹就是时空中的路径

三、方法详解

3.1 整体框架

点云 → [3D Backbone (VoxelNet/PointPillars)] → BEV特征图M ↓ [第一阶段:中心点检测头] - 热力图(中心点) - 尺寸/高度/朝向/速度回归 ↓ [第二阶段:精炼] - 5个表面中心点特征提取 - IoU引导置信度 + 框回归精炼 ↓ [跟踪:贪心最近点匹配]

3.2 第一阶段:中心点检测

① 中心热力图头(Center Heatmap Head)
  • 输出KKK通道热力图Y^∈[0,1]W×H×K\hat{Y} \in [0,1]^{W \times H \times K}Y^[0,1]W×H×KKKK为类别数)
  • 训练目标:在每个GT物体中心的BEV投影处渲染2D高斯核
  • 使用Focal Loss监督

关键改进 — 增大高斯半径:
σ=max⁡(f(w,l), τ),τ=2\sigma = \max(f(w, l),\ \tau), \quad \tau = 2σ=max(f(w,l),τ),τ=2

原因:BEV俯视图中物体比图像中更稀疏,标准CenterNet的高斯半径导致监督信号过于稀疏。增大半径使模型获得更密集的监督。

② 回归头(Regression Heads)

在中心点特征处回归以下属性:

属性维度说明
亚体素偏移oooR2\mathbb{R}^2R2补偿体素化和stride引入的量化误差
离地高度hgh_ghgR\mathbb{R}R补充BEV投影丢失的高程信息
3D尺寸sssR3\mathbb{R}^3R3回归对数尺寸(处理不同尺度)
朝向(sin⁡α,cos⁡α)(\sin\alpha, \cos\alpha)(sinα,cosα)R2\mathbb{R}^2R2连续回归目标
  • 每个属性使用独立的卷积分支
  • 训练时仅在GT中心位置用L1 Loss监督
③ 速度头(Velocity Head)与跟踪
  • 预测2D速度v∈R2v \in \mathbb{R}^2vR2:当前帧与上一帧物体位置差
  • 需要两帧输入(当前帧 + 前一帧)
  • 同样用L1 Loss监督

跟踪算法(极简):

  1. 用负速度将当前帧检测中心投影回上一帧
  2. 与已有轨迹进行最近距离贪心匹配
  3. 未匹配轨迹保留T=3T=3T=3帧后删除
  4. 无需卡尔曼滤波器,跟踪仅需1ms

3.3 第二阶段:精炼(Two-Stage Refinement)

动机
  • 第一阶段所有属性都从中心点特征推断
  • 但传感器通常只能看到物体侧面,中心点可能无观测
方法
第一阶段预测的3D框 → 提取5个点的特征 → MLP → 置信度分数 + 框精炼 ↑ 框中心 + 4个外侧面中心 (顶面和底面中心与框中心在BEV重合)
  • 从backbone的BEV特征图MMM中用双线性插值提取特征
  • 拼接5个点特征 → 共享2层MLP → 两个分支
置信度目标(IoU引导)

I=min⁡(1, max⁡(0, 2×IoUt−0.5))I = \min(1,\ \max(0,\ 2 \times \text{IoU}_t - 0.5))I=min(1,max(0,2×IoUt0.5))

Lscore=−Itlog⁡(I^t)−(1−It)log⁡(1−I^t)L_{\text{score}} = -I_t \log(\hat{I}_t) - (1-I_t)\log(1-\hat{I}_t)Lscore=Itlog(I^t)(1It)log(1I^t)

最终置信度

Q^t=Y^t⋅I^t\hat{Q}_t = \sqrt{\hat{Y}_t \cdot \hat{I}_t}Q^t=Y^tI^t

(第一阶段类别分数与第二阶段IoU分数的几何平均)

3.4 网络架构细节

组件结构
第一阶段共享层3×3 Conv + BN + ReLU
各回归分支2个 3×3 Conv(BN + ReLU)
第二阶段MLP2层共享MLP(BN + ReLU + Dropout 0.3)→ 2个3层FC分支

3.5 训练配置

项目nuScenesWaymo
检测范围[−51.2,51.2]2[-51.2, 51.2]^2[51.2,51.2]2m,[−5,3][-5, 3][5,3]m[−75.2,75.2]2[-75.2, 75.2]^2[75.2,75.2]2m,[−2,4][-2, 4][2,4]m
Voxel大小0.1×0.1×0.2 m0.1×0.1×0.15 m
Pillar大小0.2×0.2 m0.32×0.32 m
优化器AdamWAdamW
学习率1e-3 (one-cycle)3e-3 (one-cycle)
Batch Size16 (4×V100)
Epochs2030
数据增强翻转 + 缩放 + 旋转 + GT采样翻转 + 缩放 + 旋转
二阶段采样128个框(1:1正负比,IoU>0.55为正)同左

四、实验结果

4.1 Waymo测试集 — 3D检测

方法Vehicle mAPH (L2)Pedestrian mAPH (L2)
PointPillars55.145.1
PPBA59.155.8
RCD64.7
CenterPoint71.866.4

超越此前所有方法:车辆 +7.1 mAPH,行人 +10.6 mAPH

4.2 nuScenes测试集 — 3D检测

方法mAP↑NDS↑PKL↓
PointPillars40.155.01.00
CBGS (2019冠军)52.863.30.77
CenterPoint58.065.50.69

超越去年冠军 +5.2 mAP, +2.2 NDS

4.3 3D跟踪

Waymo测试集:

方法Vehicle MOTA (L2)Pedestrian MOTA (L2)
AB3D (官方基线)40.137.7
CenterPoint59.456.6

超越官方基线 +19.4 / +18.9 MOTA

nuScenes测试集:

方法AMOTA↑IDS↓
AB3D15.19027
Chiu et al. (2019冠军)55.0950
CenterPoint63.8760

超越去年冠军 +8.8 AMOTA,跟踪仅需1ms

4.4 推理速度

数据集速度
Waymo11 FPS
nuScenes16 FPS

五、关键消融实验

5.1 Center-based vs Anchor-based(核心对比)

Waymo验证集:

Backbone方法VehiclePedestrian平均 mAPH
VoxelNetAnchor-based66.154.460.3
VoxelNetCenter-based66.562.764.6 (+4.3)
PointPillarsAnchor-based64.150.857.5
PointPillarsCenter-based66.557.462.0 (+4.5)

仅切换表示方式(anchor→center),即获得3-4 mAP提升!

5.2 不同朝向角度的性能(Waymo验证集)

方法车辆 0°-15°车辆 30°-45°行人 0°-15°行人 30°-45°
Anchor-based67.145.455.926.5
Center-based67.851.6 (+6.2)64.035.7 (+9.2)

大角度旋转物体,center-based优势极为显著。

5.3 一阶段 vs 二阶段

配置VehiclePedestrian额外耗时
一阶段66.562.7
+框中心特征68.064.9+5ms
+表面中心特征68.365.3+6ms
密集采样(6×6)68.265.4+8ms

5个表面中心点特征即可达到与密集采样相当的性能,且更快更简单。

5.4 跟踪器对比(nuScenes验证集)

检测器跟踪器AMOTA跟踪耗时
CenterPointPoint (本文)63.71ms
CenterPointKalman Filter60.073ms
CBGSPoint59.81ms
CBGSKalman Filter56.173ms

简单的最近点匹配全面优于卡尔曼滤波器,且快73倍。


六、与SECOND的关系

CenterPoint论文明确引用SECOND作为其3D backbone之一(VoxelNet/SECOND):

对比维度SECOND (2018)CenterPoint (2020)
检测表示Anchor-basedCenter-based (anchor-free)
检测头RPN + 固定anchor热力图关键点检测
角度回归正弦损失 + 方向分类器sin/cos连续回归
跟踪速度预测 + 最近点匹配
二阶段5点特征精炼
数据集KITTIWaymo + nuScenes
核心贡献稀疏卷积加速表示方式革新

CenterPoint可视为在SECOND等backbone之上,用更优的输出表示(点代替框)进一步提升性能。


七、论文核心贡献总结

  1. 提出center-based 3D检测框架:将3D物体表示为点而非框,天然旋转不变,减少搜索空间
  2. 设计轻量二阶段精炼:仅提取5个表面中心点特征,+6ms即获+2 mAP提升
  3. 极简跟踪算法:速度预测 + 贪心最近点匹配,1ms完成,无需卡尔曼滤波
  4. SOTA性能:Waymo和nuScenes双榜第一,NeurIPS 2020挑战赛Top4中3个方案采用

八、局限性与讨论

局限说明
nuScenes二阶段无提升32线LiDAR仅30k点/帧,点太稀疏限制了精炼效果
行人检测受限于体素分辨率PointPillars中行人通常仅占1个像素
依赖BEV投影仍丢失部分3D几何信息(相比全3D方法)
未利用图像信息纯LiDAR方法,未融合相机语义(后续工作可改进)

九、一句话总结

CenterPoint证明了一个简洁而深刻的洞察:在3D世界中,用"点"表示物体比用"框"更自然、更高效、更准确——检测是找中心点,跟踪是连点成线。

http://www.cnnetsun.cn/news/3737968.html

相关文章:

  • 海洛hi原图各位设计师看过来,一张图片告诉你如何下载Shutterstock
  • 口碑好的大模型电话机器人哪家专业
  • Unity VFX Graph与FluvioFX结合案例:打造电影级流体特效
  • EventBus事件模型详解:id、topic、data与可选属性的最佳配置
  • Specificity Graph核心功能解析:CLI、Node模块与浏览器集成全攻略
  • 南京庭院返潮怎么办?后悔没早知道这5步排水优化方案
  • 软技能修炼:从“技术人“到“靠谱人“
  • 肖特基二极管阵列TVS/ESD静电保护芯片:NUP4302MR6T1G
  • AOP切入点表达式(execution和annotation)一般用execution
  • [SQL实战] 查询一慢就想加索引?先按这几步排查,后面才不会越改越乱
  • 仅剩47家头部科技公司内部流通的AI工具链白皮书:TensorFlow/PyTorch/Keras三大生态协同架构设计(PDF已脱敏)
  • AI时代 最值得培养的能力是什么? -- 《吾辈如神》作者给出的10点建议
  • 为什么需要人在回路?达尔文.skill独特的三层守关机制详解
  • 终极指南:如何在安卓设备上实现低延迟游戏串流-Moonlight阿西西修改版详解
  • 大数据开发面试必问:C++引用背后的高性能设计思想
  • 网络电源响铃配置
  • 库存预测准确率从68%跃升至91.7%:基于LSTM-XGBoost融合模型的工业级调参手册
  • 终极指南:如何高效使用novel-downloader构建个人数字图书馆
  • 3分钟掌握阅读APP免费书源配置终极指南:轻松打造个人专属小说图书馆
  • 深圳阿里云代理商:RAG知识库回答不准确?3步排查文档切分、检索与重排参数
  • 2026人工智能招投标工具推荐:本地智能体与商用平台多场景选型测评指南
  • 北京华恒智信破解化工国企职级晋升无通道难题
  • Cell子刊重磅:结直肠癌存在神经-基质自放大环路,双靶点阻断开辟全新治疗思路
  • LeCun强推了一个3b小模型,你的cpu都能跑
  • API 中转站怎么选?先看 4SToken,再看其他备选
  • SM2国密算法实战指南:从原理到Node.js跨平台集成
  • 四向车选哪家|2026 硬核选型指南:参数、品牌、场景全维度解析
  • Web安全实战:从信息搜集到权限提升的完整渗透测试路径解析
  • 自定义SpringBoot Starter:tech-pdai-spring-demos中的组件封装与复用
  • Scratch小猫走迷宫:图形化编程入门实践与核心逻辑解析