使用机器学习技术进行语音情感识别:特征提取和对卷积神经网络和随机森林的比较
Mohammad Mahdi Rezapour Mashhadi1, Kofi Osei-Bonsu2
1Independent Researcher, Mashhad, Iran.
PloS one
|November 21, 2023
概括
这项研究使用音频功能和机器学习增强了语音情感识别 (SER). 具有特征选择的随机森林优于其他模型,在将情绪从语音分类中达到69%的准确性.
科学领域:
- 计算语言学 计算语言学
- 机器学习 机器学习
- 信号处理 信号处理
背景情况:
- 语言是表达情绪的主要道.
- 准确的语音情感识别 (SER) 对人机交互至关重要.
- 有限的数据集对开发强大的SER模型构成挑战.
研究的目的:
- 用各种音频功能和机器学习模型来分类语音中的情绪.
- 评估随机森林 (RF) 的性能,与一维卷积神经网络 (conv1D) 进行特征选择.
- 调查SER中常见的错误分类问题.
主要方法:
- 音频特征的提取:Mel频率的塞普斯特拉系数,色谱图,Mel尺度的光谱图,光谱对比度,Tonnetz和零交叉率.
- 在分析之前,数据集增强和所有音频文件的组合.
- 用特征选择和SER的conv1D模型对射频进行比较.
主要成果:
- 与conv1D相比,具有特征选择的RF实现了更高的平均精度 (69%).
- 射频对恐惧 (72%) 和平静 (84%) 的回忆表现出最高的精度.
- 常见的错误分类包括愤怒与快乐,厌恶与悲伤/中立,和恐惧与悲伤,归因于声学特征相似之处.
结论:
- 具有特征选择的RF对于SER是有效的,特别是在有限的数据集.
- 这项研究强调了声学特征分析对情绪分类的潜力.
- 了解错误分类模式可以指导SER系统的未来改进.


