针对信息减弱的创新小目标检测方法:融合增强的可编程梯度信息和新的Mamba模块
Yang Liu1,2, Yatu Ji1, Qingdaoerji Ren1
1School of Information Engineering, Inner Mongolia University of Technology, Hohhot 010051, China.
Sensors (Basel, Switzerland)
|April 12, 2025
概括
这项研究引入了PGI-ViMamba,通过防止信息丢失来提高深度学习中的小目标识别. 这种新的方法提高了准确性,而不会牺牲关键数据集的回忆率.
科学领域:
- 计算机视觉 计算机视觉
- 深度学习 (Deep Learning) 是一种深度学习.
- 人工智能的人工智能
背景情况:
- 深度神经网络在层次的特征提取过程中经常遭受重大信息损失,特别影响小目标检测.
- 这种信息瓶理论表明,信息丢失和算法识别率降低之间存在直接的相关性.
- 现有的方法在整个深度学习过程中都难以保持小对象的关键特征信息.
研究的目的:
- 提出一种新的神经网络模型,PGI-ViMamba,旨在减轻深度学习中的信息减弱.
- 通过在向前传播期间保留特征信息来提高小目标识别的精度.
- 为了减少模型参数,同时提高小型目标的识别能力.
主要方法:
- 拟议的PGI-ViMamba模型包含一个多层次的注意力门可编程梯度信息 (MLAG PGI) 机制.
- 它使用改进的VSS模块作为其骨干中的功能提取器.
- 一个辅助分支,灵感来自于YOLOv9,是集成的,和MLAG PGI功能作为可逆分支可靠的梯度信息.
主要成果:
- 与最先进的模型相比,PGI-ViMamba在VisDrone数据集上提高了1.1%的小目标识别精度,在DOTA-v1.5数据集上提高了2.1%.
- 该模型在没有显著降低召回率的情况下实现了这些精度增长.
- 废弃实验证实了MLAG PGI和SPD-Conv-VSS模块的个别有效性.
结论:
- PGI-ViMamba有效地对抗深层神经网络中的信息衰减,从而达到更高的小目标识别精度.
- 整合MLAG PGI和SPD-Conv-VSS模块对该模型的性能作出了重大贡献.
- 拟议的架构为提高计算机视觉应用中小目标检测精度提供了一个有希望的解决方案.


