基于多重注意力融合ResNet的多声声音事件定位和检测
Shouming Zhang1, Yaling Zhang1,2, Yixiao Liao2
1Faculty of Information Engineering and Automation, Kunming University of Science and Technology, Kunming 650500, China.
Mathematical biosciences and engineering : MBE
|March 8, 2024
概括
这项研究引入了一种新的多重注意力融合ResNet,用于准确的声音事件定位和检测. 该模型有效处理多声和噪声,在复杂的声学环境中表现优于现有方法.
科学领域:
- 声学和信号处理
- 机器学习用于音频分析
背景情况:
- 声音事件定位和检测在各种应用中至关重要.
- 多声和噪声干扰对准确的声音事件预测和定位构成重大挑战.
研究的目的:
- 开发一个先进的深度学习模型,用于强大的声音事件本地化和检测.
- 在复杂的声学环境中应对多声和噪声干扰的挑战.
主要方法:
- 提出了一个基于ResNet34的多重注意力融合ResNet架构.
- 整合了封闭式通道转换来增强剩余的块,改善上下文信息捕获和降低噪音.
- 分分注意力和协调注意力机制用于管理跨道信息,并专注于空间声音事件特征.
主要成果:
- 拟议的模型显示了与最先进的方法相比显著的性能改进.
- 在具有多重多声声音和方向噪声干扰的环境中,可以实现卓越的性能.
- 在单个多声波声音干扰的场景中获得了竞争性结果.
结论:
- 多重注意力融合ResNet有效地增强了声音事件本地化和检测能力.
- 模型的注意力机制是减轻多声和噪音干扰的关键.
- 这项研究为现实世界的声音分析挑战提供了有希望的解决方案.


