使用高级描述符对人机交互进行情感识别
Chaitanya Singla1, Sukhdev Singh2, Preeti Sharma1
1Chitkara University Institute of Engineering and Technology, Chitkara University, Punjab, India.
Scientific reports
|May 27, 2024
概括
这项研究引入了一种新的深度学习 (DL) 方法,用于旁遮普语的语音情感识别 (SER),达到69%的准确性. 该方法使用光谱图和社交媒体数据,优于传统技术.
科学领域:
- 人工智能的人工智能
- 语音处理 语音处理
- 机器学习 机器学习
背景情况:
- 深度学习 (DL) 越来越多地用于语音情感识别 (SER).
- 对于旁遮普语说话者来说,SER的关注度越来越大.
- 现有的旁遮普语SER方法缺乏足够的准确性.
研究的目的:
- 开发和评估一种新的基于DL的方法,用于Punjabi语言的SER.
- 从社交媒体构建和预处理一个标记的旁遮普语语音语料库.
- 为了提高旁遮普语语音信号中情感识别的准确性.
主要方法:
- 使用卷积神经网络 (CNN) 进行SER.
- 采用光谱图作为主要特征表示.
- 创建了来自社交媒体的Punjabi电影和网络系列的自定义数据集.
主要成果:
- 拟议的DL方法在Punjabi SER.中实现了69%的准确性.
- 超过传统方法的表现:决策树 (49%),天真湾 (52%) 和随机森林 (61%).
- 证明了对情感识别的歧视性模式的有效学习.
结论:
- 新的DL方法显著提高了旁遮普语语音情感识别的准确性.
- 基于光谱图的特征表示对于这个任务是有效的.
- 社交媒体是创建语音情感数据集的可行来源.


