不统一的扬声器解用于从原始语音信号中检测抑郁
Jinhan Wang1, Vijay Ravi1, Abeer Alwan1
1Dept. of Electrical and Computer Engineering, University of California, Los Angeles, USA.
概括
这项研究引入了一种用于抑郁症检测的新型语音分析方法,通过解开说话者的身份来保护患者的隐私. 该方法提高了抑郁症检测的准确性,同时显著减少了对说话者特定信息的依赖.
科学领域:
- 计算语言学计算语言学
- 精神病学是一个精神病学.
- 机器学习用于医疗保健
背景情况:
- 语音分析是抑郁症检测的一个有希望的途径.
- 目前的方法通常依赖于扬声器身份特征,引发隐私问题.
- 扬声器嵌入,虽然有效,但可以无意中透露个人信息.
研究的目的:
- 开发一种保护隐私的方法,用于基于语音的抑郁症检测.
- 从与抑郁相关的语音特征中解脱说话者的身份.
- 为了提高抑郁症检测的准确性,而不影响患者的保密性.
主要方法:
- 提出了一种使用非统一的对抗性扬声器识别 (SID) 损失最大化的扬声器解技术.
- 在培训期间,在不同的模型层中实施了可变对抗权重机制.
- 使用ECAPA-TDNN模型架构进行语音特征提取和分析.
主要成果:
- 在DAIC-WoZ数据集上获得了0.7349的F1得分,超过了最先进的 (SOTA) 音频单一方法的3.7%.
- 语音识别准确度降低了50%,表明语音身份的成功解.
- 证明初始层中较高的对抗权重与改善的抑郁症检测性能相关.
结论:
- 基于语音的抑郁症检测是可行的,而不影响患者的隐私.
- 拟议的扬声器解方法有效地将扬声器身份与抑郁症指示性语音特征分开.
- 这项研究为人工智能在心理健康领域更加道德和隐私意识的应用铺平了道路.


