多任务学习用于基于音频的婴儿哭声检测和推理
IEEE journal of biomedical and health informatics
|September 3, 2024
概括
这项研究引入了一种新的婴儿哭声检测和推理 (ICDR) 模型,以改善婴儿哭声分析. ICDR模型通过使用多任务学习和一种新的对比的专家混合方法来增强概括性.
科学领域:
- 机器学习 机器学习
- 婴儿健康监测 婴儿健康监测
- 信号处理 信号处理
背景情况:
- 婴儿哭泣分析对于了解婴儿福祉至关重要,但有限的数据集和个体声音变化阻碍了模型的性能.
- 现有的模型由于数据稀缺和婴儿哭泣的特定主题声学差异而难以通用.
研究的目的:
- 为婴儿哭声检测和推理 (ICDR) 开发一个强大的多任务模型,克服数据限制和主题变化.
- 提高人工智能模型在解释婴儿发声时的准确性和概括能力.
主要方法:
- 提出了一个多任务学习框架,利用两个数据集来增加数据多样性.
- 引入了一个高效的注意力模块,用于跨任务的功能丰富.
- 实施了专家 (CMoE) 模块的任务内对比混合,以减少主题差异和增强表示一致性.
主要成果:
- 与最先进的方法相比,ICDR模型在婴儿哭声检测和推理方面表现优越.
- 在广泛的跨学科实验中,在F1得分 (2-9%) 中取得了显著的改善.
- 验证了多任务学习和CMoE模块在增强模型概括方面的有效性.
结论:
- 多任务学习与任务间的注意力和任务内部的CMoE显著提高了婴儿哭声分析模型的概括能力.
- 拟议的ICDR模型为在现实应用中更可靠的婴儿哭声解释提供了一个有希望的解决方案.


