C2BG-Net:具有全球语义的跨模态和跨规模平衡网络,用于多模态3D对象检测
Bonan Ding1, Jin Xie1, Jing Nie2
1School of Big Data and Software Engineering, Chongqing University, Chongqing, 400044, China.
概括
这项研究引入了用于多模式3D物体检测的新型网络,通过平衡传感器数据意义来改善特征聚合. 提出的方法提高了自动驾驶应用中的准确性.
科学领域:
- 计算机视觉 计算机视觉
- 机器人技术 机器人技术 机器人技术
- 人工智能的人工智能
背景情况:
- 多模式3D物体检测融合了RGB图像和激光雷达点云,用于自动驾驶.
- 现有的方法使用简单的特征聚合 (加法/乘法),努力平衡模式意义,并可能引入噪音.
- 不同层次的图像特征表现出受感场失衡,阻碍了全面分析.
研究的目的:
- 开发先进的网络,以便在3D物体检测中有效地进行多模式特征聚合.
- 为了解决平衡RGB和激光雷达数据之间的重要性的挑战.
- 为了克服多层次图像特征中的受感场不平衡,以改善检测.
主要方法:
- 提出了两个新型网络:交叉模式网络 (CMN) 和交叉规模网络 (CSN).
- CMN利用跨模式的注意力和辅助的2D检测头来实现平衡的特征意义.
- CSN使用交叉尺度的注意力来协调不同级别的图像的不同受体场. 引入了局部与全球voxel注意编码器 (LGVAE) 进行增强的点级特征提取.
主要成果:
- 拟议的CMN和CSN网络在各种3D对象检测框架中表现出一致的改进.
- 在具有挑战性的密集硬集上,在基线MVXNet上取得了显著的3.1%绝对收益.
- 在KITTI,Dense和nuScenes基准上验证了有效性和多功能性.
结论:
- 开发的CMN和CSN网络为多模式特征聚合提供了一种优越的方法.
- 这些方法有效地平衡了模态意义,解决了受感场差异,提高了3D对象检测性能.
- 提出的技术显示出对推进自动驾驶感知系统的重大前景.


