多模式机器学习用于语言和语音标记在心理健康的识别
Georgios Drougkas1, Erwin M Bakker1, Marco Spruit2,3
1Leiden Institute of Advanced Computer Science, Leiden University, Leiden, The Netherlands.
BMC medical informatics and decision making
|November 23, 2024
概括
这项研究表明,结合文本和音频数据的多式联络方法可以优于单式联络方法来诊断广泛的心理健康障碍,特别是在识别积极病例时. 进一步的改进可以提高多式联运诊断的准确性.
科学领域:
- 计算精神病学是一种计算精神病学.
- 机器学习在医疗保健中的应用
- 多模式数据分析数据分析多模式数据分析
背景情况:
- 现有研究经常使用单模态方法来治疗多种疾病,或单模态方法来治疗单个疾病.
- 这项研究通过编制各种精神疾病的标志物来解决这个差距,用于单模和多模诊断.
研究的目的:
- 确定多式联络方法是否在诊断各种精神健康障碍时优于单式联络方法.
- 评估将文本和音频数据用于心理健康诊断的有效性.
主要方法:
- 利用DAIC-WOZ数据集,专注于文本和音频模式.
- 开发了单模式文本和音频模型,以及使用早期融合的多模式模型.
- 应用机器学习算法 (SVM,物流回归,随机森林,密集层) 并使用准确性,AUC-ROC和F1分数进行评估.
主要成果:
- 单模式文本模型实现了78-87%的准确性和85-93%的AUC-ROC.
- 单模式音频模型实现了64-72%的精度和53-75%的AUC-ROC.
- 多模式模型的准确性 (80-87%) 和AUC-ROC (84-93%) 与文本模型相似,但F1得分更高,特别是在积极的情况下.
结论:
- 多模式模型显示出超越单模式方法的潜力,特别是在精细的功能工程和标签创建方面.
- 强调多式联运一体化对于推进心理健康诊断的重要性.
- 建议先进的融合技术和深度学习模型的未来研究方向.


