微调一个预先训练的CNN与自我注意力相结合,用于语音情感识别
概括
这项研究引入了一种新的语音情感识别 (SER) 系统,使用CNN和自我注意力. 这种新方法准确地识别了语音中的情绪,显示了医疗保健应用的前景.
科学领域:
- 人工智能的人工智能
- 机器学习 机器学习
- 信号处理 信号处理
背景情况:
- 语音情感识别 (SER) 对于医疗保健应用,如患者监测和心理健康至关重要.
- 之前的SER模型经常使用CNN和RNN,但RNN是计算密集且缓慢的.
- 需要一种更有效的方法来捕捉语音信号中的空间和时间特征.
研究的目的:
- 通过将自我注意机制与CNN集成来开发一个改进的SER系统.
- 克服RNN在处理情绪识别的序列数据方面的局限性.
- 提高SER在医疗保健和人机交互方面的准确性和效率.
主要方法:
- 语音信号被细分并转换成Mel谱图.
- 一个预训练有素的CNN提取了内部光谱图的特征.
- 一个自我注意力机制模拟了频谱间的依赖性,以捕捉时间模式.
- 该网络在数据集上进行了微调,其中包括愤怒,快乐,悲伤和中性情绪.
主要成果:
- 拟议的CNN和自我注意力模型实现了0.812.8的未加权平均回忆.
- 通过独立于主体的交叉验证来验证性能.
- 该系统在识别未见对象的情绪状态方面表现出有效性.
结论:
- 将自我注意与CNN集成,可以提高SER的性能.
- 这种方法为SER提供了一个计算效率高的RNN替代方案.
- 开发的SER技术对情感敏感的医疗保健和其他AI应用具有重大潜力.

