在资源有限的硬件上,用于单眼深度估计的高效注意力视觉变压器
Claudio Schiavella1, Lorenzo Cirillo2, Lorenzo Papa2,3
1Department of Computer, Control and Management Engineering (DIAG), Sapienza University of Rome, Rome, 00185, Italy. schiavella@diag.uniroma1.it.
Scientific reports
|July 4, 2025
概括
这项研究通过降低计算成本,优化视觉变压器用于单眼深度估计. 高效的注意力模块可以提高推断速度而不会牺牲准确性,有利于车载应用程序.
科学领域:
- 计算机视觉 计算机视觉
- 深度学习 (Deep Learning) 是一种深度学习.
- 人工智能的人工智能
背景情况:
- 视觉转换器在复杂的任务中取得了最先进的结果,例如单眼深度估计.
- 变压器中的注意力机制具有二次计算成本,导致推断速度缓慢,特别是在资源有限的环境中.
研究的目的:
- 为了降低视觉变压器网络的计算成本,用于单眼深度估计.
- 为了在估计质量和推断速度之间实现最佳平衡.
- 评估网络优化策略,以提高机载应用程序的效率.
主要方法:
- 利用高效的注意力模块来降低计算复杂性.
- 应用优化到整个网络,以及独立的编码器和解码器.
- 使用帕雷托前沿分析来确定质量和推断时间之间的最佳权衡.
主要成果:
- 优化的网络表现出与基线模型相比或超过的性能.
- 在各种优化架构中,在推断速度方面取得了显著的改进.
- 该研究成功地确定了提高单眼深度估计效率的有效策略.
结论:
- 有效的注意力机制对于加速基于视觉转换器的单眼深度估计至关重要.
- 网络优化,包括有针对性的编码器/解码器调整,增强了性能和速度的权衡.
- 这项研究为在实时,基于边缘的应用程序中部署先进的深度学习模型提供了途径.


