一个合并的CNN架构用于语音情感识别
Rolinson Begazo1, Ana Aguilera2,3, Irvin Dongo1,4
1Electrical and Electronics Engineering Department, Universidad Católica San Pablo, Arequipa 04001, Peru.
Sensors (Basel, Switzerland)
|September 14, 2024
概括
这项研究通过使用深度学习提高了语音中的情感识别. 一种结合光谱特征和光谱图像的新方法实现了96%的准确性,改善了人机交互.
科学领域:
- 人工智能的人工智能
- 语音处理 语音处理
- 人与计算机的交互
背景情况:
- 从语音中识别情绪对于人机交互 (HCI) 是至关重要的.
- 现有的深度学习方法面临着数据量,多样性和特征选择标准的挑战.
- 为语音情感识别设计有效的神经网络架构仍然是复杂的.
研究的目的:
- 用深度学习来解决当前语音情感识别技术的局限性.
- 提出一种包括数据预处理,特征选择和新型神经网络架构在内的综合方法.
- 开发和利用一个统一的数据集 (EmoDSc) 强大的情感识别.
主要方法:
- 通过结合现有的语音情感数据库,构建一个统一数据集 (EmoDSc).
- 研究用于情感识别的光谱特征和光谱图像之间的协同作用.
- 开发一种混合神经网络架构,集成1D卷积神经网络 (CNN1D),2D CNN (CNN2D) 和多层感知器 (MLP),以融合光谱和基于图像的功能.
主要成果:
- 个别分析显示,光谱特征的加权精度为89%,光谱图像的加权精度为90%.
- 拟议的混合模型使用了EmoDSc数据集,实现了96%的显著加权准确率.
- 合并方法显著优于依赖于孤立特征类型的模型.
结论:
- 拟议的深度学习方法,通过混合CNN-MLP架构结合光谱特征和光谱图像,显著提升了语音情感识别.
- 统一的EmoDSc数据集为训练和评估语音情感识别模型提供了宝贵的资源.
- 这项研究提供了一个强大的解决方案,以提高人机交互系统中情感识别的准确性和可靠性.


