关于使用前置声纳和转移学习方法开发用于未爆炸武器分类的声学图像数据集
Piotr Ściegienka1,2, Marcin Blachnik3
1Joint Doctoral School, Silesian University of Technology, 44-100 Gliwice, Poland.
Sensors (Basel, Switzerland)
|September 28, 2024
概括
研究人员创建了一个声纳声学图像数据集,用于分类未爆炸弹药 (UXO) 和非UXO. 预训练整个网络达到98%的准确性,VGG模型表现最好.
科学领域:
- 海洋机器人和自主系统
- 人工智能和机器学习
- 声纳成像和信号处理.
背景情况:
- 水下未爆炸弹药 (UXO) 检测对于海上安全和基础设施发展至关重要.
- 目前的检测方法通常依赖于视觉或磁性调查,在某些环境中存在局限性.
- 声学成像为UXO识别提供了一个有希望的替代方案,但需要强大的数据集和先进的分类算法.
研究的目的:
- 开发一套全面的前性声纳声学图像数据集,用于分类未爆炸弹药 (UXO) 和非UXO.
- 建立一个基准来评估机器学习模型在UXO检测使用声学数据.
- 调查各种深度学习架构的有效性,并为此分类任务转移学习技术.
主要方法:
- 在Gazebo中使用数字双胞胎模拟生成了69444张声学图像 (512x399分辨率) 的数据集,其中包括UXO和非UXO类.
- 评估了包括VGG16,ResNet34/50,ViT,RegNet和Swin Transformer在内的最先进的图像分类模型.
- 实验涉及两个神经网络预训练策略:只有最后层,以及整个网络.
主要成果:
- 所有评估的模型都实现了可比性能,当整个网络进行预训练时,达到98%的平衡精度.
- 预先培训整个网络被认为是实现高分类准确性的必要条件.
- 在测试的架构中,VGG模型出乎意料地产生了最高的准确性.
结论:
- 一个用于基于声学的UXO分类的高性能数据集已经成功开发出来.
- 深度学习模型,特别是完全预训练后的模型,显示出使用声纳图像进行准确的UXO检测的巨大潜力.
- VGG模型的卓越性能表明,这种声学分类任务具有特定的建筑优势,需要进一步研究.


