轻量级单眼深度估计使用融合改进的变压器
Xin Sui1, Song Gao2, Aigong Xu1
1School of Geomatics, Liaoning Technical University, Fuxin, 123000, China.
Scientific reports
|September 28, 2024
概括
这项研究引入了一个轻量级的深度学习网络,用于准确的深度估计. 这种新的架构结合了卷积神经网络 (CNN) 和变压器,以实现高效的本地和全球特征提取,实现高精度和实时性能.
科学领域:
- 计算机视觉 计算机视觉
- 深度学习 (Deep Learning) 是一种深度学习.
- 人工智能的人工智能
背景情况:
- 现有的深度估计网络往往将准确性优先于计算效率.
- 需要轻量级模型,可以捕捉本地和全球图像特征,以有效估计深度.
研究的目的:
- 提出一个轻量级,自我监督的网络,用于准确和高效的深度估计.
- 整合卷积神经网络 (CNN) 和变压器,以增强特征提取.
主要方法:
- 一个浅的CNN,具有深度可分离的卷积,用于改进受体场.
- 具有多深度可分离卷积头的变压器转换了注意模块,以减少计算负载.
- 为了更好的非线性表示,Feedforward网络中采用了双步门机制.
主要成果:
- 拟议的网络与其他轻量级模型相比,在较少的参数中实现了更高的估计准确性.
- 在各种户外数据集中表现出卓越的概括性.
- 实现87 FPS的快速推断速度,平衡速度和准确性.
结论:
- 集成的CNN-Transformer网络有效地捕捉了当地和全球的背景,以进行深度估计.
- 该模型为需要高效准确的深度估计的实时应用提供了引人注目的解决方案.


