MHS-VIT:Mamba混合自我注意力视觉变压器用于交通图像检测
Xude Zhang1,2, Weihua Ou3, Xiaoping Wu2
1Engineering Research Center of Micro-Nano and Intelligent Manufacturing, Ministry of Education, Kaili University, Kaili, Guizhou, China.
PloS one
|June 30, 2025
概括
一个新的Mamba混合自我注意视觉变压器 (MHS-VIT) 通过结合Mamba状态空间模型和变压器来改善交通图像检测. 这种混合型号提高了车辆和行人检测等任务的效率和准确性.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 智能运输系统 智能运输系统
背景情况:
- 变压器模型具有先进的交通图像检测,但由于二进制自我注意复杂性而遭受高计算成本.
- 这限制了它们在资源有限的智能运输系统中的部署.
- 复杂的交通场景的高效处理需要平衡性能与计算效率的模型.
研究的目的:
- 引入一种新的混合架构,即Mamba混合自我注意视觉转换器 (MHS-VIT),用于改进交通图像检测.
- 利用Mamba状态空间模型 (SSM) 的线性复杂性和变压器的空间依赖性建模.
- 提高视觉处理在交通图像分析中的效率和准确性.
主要方法:
- 开发了一种混合架构 (MHS-VIT),将Mamba SSM与变压器组件集成在一起.
- 利用Mamba的线性时间复杂度来减少计算负担.
- 使用变压器的自我注意力来捕捉交通场景中关键的远程空间依赖.
主要成果:
- MHS-VIT在交通图像检测任务中表现出色,包括车辆检测,行人检测和交通信号识别.
- 该模型实现了对目标对象的准确和快速识别.
- 与同等规模的骨干网络相比,MHS-VIT在准确性和模型参数数量的减少方面显示出显著的改进.
结论:
- 拟议的MHS-VIT有效地解决了传统变压器在交通图像分析中的计算局限性.
- 混合方法成功地结合了Mamba SSM和变压器的优势,以实现高效和准确的视觉感知.
- 对于需要高性能,资源高效的图像检测的先进智能运输系统,MHS-VIT提供了一个有前途的解决方案.
