语义增强和时间精细的双向BEV融合用于LiDAR-摄像头3D对象检测
Xiangjun Qu1,2, Kai Qin1,2, Yaping Li1,2
1Aerospace Information Research Institute, Chinese Academy of Sciences, Beijing 100094, China.
Journal of imaging
|September 26, 2025
概括
通过融合LiDAR和摄像头数据,SETR-Fusion增强了3D对象检测,改善了自动驾驶的感知. 这个新的战略解决了稀疏的点云和不足的交叉模式交互,以获得更准确的环境意识.
科学领域:
- 计算机视觉 计算机视觉
- 机器人技术 机器人技术 机器人技术
- 人工智能的人工智能
背景情况:
- 3D对象检测对于自动驾驶中的环境感知至关重要.
- 目前的多模式融合方法在与远距离物体的稀疏LiDAR数据和有限的交叉模式相互作用作斗争.
- 现有的框架未能充分利用LiDAR点云和相机图像之间的互补性.
研究的目的:
- 提出一种新的多式联络检测策略,即语义增强和时间精细的双向BEV融合 (SETR-Fusion).
- 通过解决当前融合框架的局限性来提高3D对象检测的准确性.
- 提高语义信息的利用和多式感知中的时间一致性.
主要方法:
- 引入了歧视性语义突出激活 (DSSA) 模块,以利用前景/背景线索的图像语义.
- 开发了时间一致的语义点融合 (TCSP) 模块,用于生成精确的语义LiDAR点云.
- 实施了双边交叉注意力融合 (BCAF) 模块,用于LiDAR和摄像头BEV功能之间的双向交叉模式交互.
主要成果:
- 在nuScenes测试组中,SETR-Fusion实现了71.2%的平均平均精度 (mAP).
- 这种方法获得了73.3%的nuScenes检测得分 (NDS),表现优于最先进的方法.
- 拟议的模块有效地解决了稀疏点云问题,并加强了跨模式信息利用.
结论:
- SETR-Fusion显著提升了多模式3D对象检测能力.
- 语义突出性,时间精细化和双向交叉注意力融合的整合被证明是有效的.
- 该战略为自主系统中强大的环境感知提供了一个有希望的方向.
