TSFNet:一个时光光谱融合网络,用于医疗应用中的高级语音情感识别
Xinran Li1, Peilin Huang1, Xiaojiang Peng1
1School of Artificial Intelligence, Shenzhen Technology University, 3002 Lantian Road, Shenzhen, 518118, Guangdong, China.
Artificial intelligence in medicine
|October 5, 2025
概括
这项研究介绍了TSFNet,一个新的时光光谱融合网络,用于高级语音情感识别 (SER). TSFNet有效地捕捉了语言中的情感细微差别,显示了医学诊断和患者护理的巨大潜力.
科学领域:
- 人工智能的人工智能
- 语音处理 语音处理
- 计算语言学 计算语言学
背景情况:
- 语音情感识别 (SER) 对于人机交互和医疗应用至关重要.
- 现有的SER方法难以捕捉微妙的情感细微差别,这对于医学诊断至关重要.
- 准确的SER可以显著改善患者护理和监测系统.
研究的目的:
- 引入TSFNet,一个时光光谱融合网络,以增强SER.
- 为了有效地整合时间和光谱语音特征,以检测微妙的情绪.
- 为了利用大规模的预训练模型来改进语音中的时间特征提取.
主要方法:
- 开发了TSFNet,一个时光光谱融合网络.
- 集成的时间和光谱语音功能使用一个插即用预先训练的模型.
- 在六个公共演讲情感数据集上评估了TSFNet的性能.
主要成果:
- 在多个数据集中,TSFNet显著超过了现有的SER基线.
- 实现了高的未加权准确率:95.57% (Savee),92.67% (Crema-D),85.71% (IEMOCAP),100.00% (Tess),95.86% (Emovo) 和80.43% (Meld) 的高不加权准确率.
- 展示了TSFNet在捕捉复杂情感细节方面的能力.
结论:
- 通过合并时间和光谱信息,TSFNet提供了一种高效的SER方法.
- 该网络显示出在推进医疗诊断工具方面的巨大潜力.
- 通过精确的情绪识别,TSFNet可以增强患者监控系统.

