MS2-CL:摄像机对LiDAR跨模态位置识别的多规模自主监督学习
Wen Liu1, Lei Ma1, Xuanshun Zhuang1
1School of Electronic Engineering, Beijing University of Posts and Telecommunications, Beijing 100876, China.
Sensors (Basel, Switzerland)
|March 14, 2026
概括
这项研究引入了一种跨模式位置识别的新方法,使机器人和自动驾驶汽车能够使用视觉和3D点云数据定位. 该方法通过学习统一的嵌入空间,克服域间隙和改进泛化来实现最先进的性能.
科学领域:
- 机器人技术和自主系统
- 计算机视觉 计算机视觉
- 机器学习 机器学习
背景情况:
- 位置识别对于自主导航至关重要,但跨模式定位 (例如,视觉到3D点云) 面临重大挑战.
- 现有的方法在领域差距,计算成本和学习视角/规模不变特征方面扎.
研究的目的:
- 开发一个强大的跨模式地点识别框架,解决当前方法的局限性.
- 为了在大型3D点云地图中实现准确的视觉定位.
主要方法:
- 制定了跨模式识别作为学习一个规模不变的,统一的嵌入空间.
- 采用分层的旋转变压器从统一的2D表示中提取多尺度的特征.
- 采用了多级自蒸模式,用于模式内知识转移.
- 在'老师'嵌入上使用全球对比损失实现了跨式调整.
主要成果:
- 在KITTI和KITTI-360数据集上实现了最先进的性能.
- 在3D点云地图中,在视觉定位方面表现出高精度.
- 在没有微调的情况下,使用KITTI训练的模型,在KITTI-360上实现了60%以上的RECALL@1.
结论:
- 拟议的方法有效地弥合了视觉和3D点云数据之间的域差距,用于位置识别.
- 规模不变的统一嵌入空间和自蒸方法提高了概括性和性能.
- 该框架为机器人和自动驾驶汽车的可靠跨模式本地化提供了一个有希望的解决方案.

