PE-MCAT:利用图像传感器融合和适应值进行半监控的3D物体检测
Bohao Li1, Shaojing Song2, Luxia Ai3
1School of Intelligent Manufacturing and Control Engineering, Shanghai Polytechnic University, Shanghai 201209, China.
Sensors (Basel, Switzerland)
|November 9, 2024
概括
通过使用点丰富模块和自适应值策略生成高精度伪标签,PE-MCAT显著改善了半监督的3D对象检测. 这种方法即使使用最小的标记数据,也提高了性能,超过了最先进的方法.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 三维物体检测框架需要大量的注释数据,从传感器数据 (例如LiDAR,摄像头) 获取这些数据是昂贵且耗时的.
- 半监督学习 (SSL) 通过减少对标记数据的依赖提供了一个解决方案,但仍然需要一些标记样本,这可能会阻碍学生-教师网络的初始培训.
- 现有的方法在点云数据中的局部特征捕获和稳定性不足,特别是有限的标记样本.
研究的目的:
- 提出PE-MCAT,这是一种新的半监督的3D物体检测方法,旨在生成高精度的伪标签.
- 解决不足的标记数据在培训强大的学生-教师网络3D物体检测的局限性.
- 通过结合多模式传感器信息和先进的特征融合技术来提高点云和伪标签的质量.
主要方法:
- 引入了点丰富模块 (PEM),该模块将图像传感器数据与点云数据集成,采用多种功能融合方法来增强本地和自主功能.
- 开发了一种多类适应值策略,用于初始过,并从教师网络输出中创建一个高质量的伪标签集.
- 实施了一项共同的可变值策略,以进一步完善伪标签集,改善培训中优质伪标签的选择.
主要成果:
- 与最先进的方法相比,PE-MCAT在各种数据集中表现出卓越的性能.
- 在KITTI数据集上,仅使用2%的标记样本,PE-MCAT取得了显著的改进:汽车的mAP为0.7%,行人为3.7%,骑自行车的人为3.0%.
- 提出的方法有效地弥补了使用最小标记数据的局限性,提高了3D对象检测的稳定性和准确性.
结论:
- PE-MCAT为3D对象检测提供了一种有效的半监督方法,大大减少了大量手动注释的需要.
- 多模式传感器数据和先进的伪标签策略的整合提高了检测模型的质量和稳定性.
- 该方法显示了基于传感器的真实世界AI应用程序的强大潜力,因为标记数据很少.


