MSFDnet:用于声音事件定位和检测的多尺度特征双层融合模型
Yi Chen1, Zhenyu Huang2, Liang Lei3
1School of Big Data and Information Industry, Chongqing City Management College, No. 151, Daxuecheng South Second Road, Shapingba District, Chongqing 401331, China.
Sensors (Basel, Switzerland)
|October 29, 2025
概括
本研究介绍了MSDFnet,这是一种用于声音事件定位和检测 (SELD) 的新型模型,通过增强特征提取和融合来提高复杂音频的准确性. 新模型在动态场景中表现出色,性能优于现有方法.
科学领域:
- 声学 声学 在声学方面
- 机器学习 机器学习
- 信号处理 信号处理
背景情况:
- 现有的声音事件定位和检测 (SELD) 方法因功能提取不足和多任务功能互补性不足而难以长时间,动态的音频.
- 这种限制限制了系统在复杂的声学环境中的性能.
研究的目的:
- 提出一种新的SELD模型,MSDFnet,旨在克服动态音频场景中当前方法的局限性.
- 通过改进特征提取和融合策略,提高声音事件检测和定位的准确性.
主要方法:
- 开发了MSDFnet,结合了多尺度特征聚合 (MSFA) 模块,用于捕捉各种空间特征.
- 实施了双层特征融合 (DLFF) 策略,以加强声音事件检测 (SED) 和到达方向 (DOA) 功能之间的关系.
- 在DCASE2020任务3数据集上对模型进行了评估.
主要成果:
- 在DCASE2020任务3数据集上,MSDFnet取得了竞争性得分,包括ER20为0.319,F20为76%,LEcd为10.2°,LRcd为82.4%,SELD得分为0.198.
- 该模型在复杂的音频场景中表现出色.
- 废弃性研究证实了MSFA和DLFF模块对整体性能的重大贡献.
结论:
- MSDFnet有效地解决了动态音频现有的SELD方法的局限性.
- 拟议的MSFA和DLFF模块显著提高了声音事件定位和检测精度.
- 该模型显示出在复杂的声学环境中对现实世界的应用有很大的潜力.


