基于动态窗口和注意力合并的等级变压器语音抑郁症检测模型研究
Xiaoping Yue1, Chunna Zhang1, Zhijian Wang1
1School of Computer Science and Software Engineering, University of Science and Technology Liaoning, Anshan, Liaoning, China.
PeerJ. Computer science
|December 9, 2024
概括
一个新的模型,DWAM-Former,通过有效地细分和整合语音特征来改善语音抑郁的检测. 这种方法提高了准确性,在通过语音模式识别抑郁症方面表现优于以前的方法.
科学领域:
- 计算语言学计算语言学
- 情感计算是一种情感计算.
- 机器学习是机器学习.
背景情况:
- 发言抑郁症检测对于心理健康评估至关重要.
- 现有的模型难以对语音数据进行细分和整合,导致信息丢失.
- 层次模型提供了潜力,但需要精细化以获得最佳性能.
研究的目的:
- 提出一种新的等级变压器模型,DWAM-Former,用于增强语音抑郁症检测.
- 为了有效地解决细分和整合抑郁语音段的挑战.
- 在语音分析中的信息合并过程中减少功能丢失.
主要方法:
- 开发了DWAM-Former,这是一个包含动态窗口和注意力合并的层次变压器模型.
- 介绍了可学习的语音分割模块 (LSSM) 用于语音和单词细分.
- 实现了适应性注意力合并 (AAM) 用于代表性特征生成和可变长度剩余模块 (VL-RM),以最大限度地减少特征损失.
主要成果:
- 在DAIC-WOZ抑郁检测数据集上,DWAM-Former在竞争中获得了0.788的MF1得分.
- 与现有的最先进的方法相比,证明了7.5%的改进.
- 有效地细分和集成语音特征,保存原始信息.
结论:
- 在语音抑郁症检测方面,DWAM-Former提供了显著的进步.
- 拟议的模块 (LSSM,AAM,VL-RM) 有效地克服了以前模型的局限性.
- 这个模型显示了通过语音分析准确和可靠的心理健康评估的希望.


