MAGTF-Net:动态语音情感识别与多尺度图表注意力和LLD特征融合
Shiyin Zhu1, Yinggang Xie1, Zhiliang Wang2
1Key Laboratory of Information and Communication Systems, Ministry of Information Industry, Beijing Information Science and Technology University, Beijing 100192, China.
Sensors (Basel, Switzerland)
|December 11, 2025
概括
我们介绍了MAGTF-Net,这是一种新的语音情感识别模型,有效地集成了多层次的声学和时间特征. 这种先进的模型显著提高了识别语言中复杂的人类情绪的准确性和稳定性.
科学领域:
- 人工智能的人工智能
- 语音处理 语音处理
- 机器学习 机器学习
背景情况:
- 传统的语音情感识别 (SER) 与复杂的情感细微差别和动态背景作斗争.
- 现有的方法往往无法捕获本地声学和全球时间语音结构.
- 目前的模型缺乏适应可变长度语音的适应性,限制了准确性和稳定性.
研究的目的:
- 提出一个新的SER模型,MAGTF-Net (多尺度注意力图形变压器融合网络).
- 为了解决捕获本地/全球特征和处理变长发言的局限性.
- 增强情感表现的表达能力,以提高识别能力.
主要方法:
- 开发了一个用多尺度注意力图 (MAG) 和变压器编码器的日志-梅尔光谱图特征提取分支.
- 使用多层感知器 (MLP) 集成了一个低级描述器 (LLD) 功能分支.
- 融合了两个分支的特征,并采用了标签光滑增强的交叉损失函数.
主要成果:
- 在 IEMOCAP 数据集上,MAGTF-Net 实现了 69.15% 的加权精度 (WA) 和 70.86% 的未加权精度 (UA).
- 该模型的表现优于几个基线SER方法.
- 废弃性研究证实了每个模块对性能的重大贡献.
结论:
- 拟议的MAGTF-Net有效地整合了SER的本地,全球和多源功能信息.
- 该模型显著提高了语言中复杂情绪表达的识别能力.
- 这项工作为语音情感识别领域提供了新的理论和实践见解.
