用文本,音频和视频来检测和评估抑郁症的多模式方法
Wei Zhang1, Kaining Mao1, Jie Chen1,2
1Department of Electrical and Computer Engineering, University of Alberta, Edmonton, AB T6G 2R3 Canada.
Phenomics (Cham, Switzerland)
|October 14, 2024
概括
一个新的多模式人工智能模型有效地使用文本,音频和视频数据检测抑郁症. 这种先进的方法克服了当前方法的局限性,在抑郁症诊断和评估中提供了更高的准确性.
科学领域:
- 人工智能的人工智能
- 临床心理学 临床心理学
- 机器学习 机器学习
背景情况:
- 抑郁症是一种普遍的精神障碍,每年发病率都在增加.
- 传统的抑郁症诊断依赖于主观的专业判断,引入潜在的偏见.
- 现有的人工智能模型难以从长文本和高维数据中提取特征.
研究的目的:
- 开发一个强大的和有效的多式联接融合模型,用于自动化抑郁症检测和评估.
- 解决当前人工智能方法在处理心理健康诊断复杂数据输入方面的局限性.
主要方法:
- 开发了一个多式联接模型,集成文本,音频和视频数据.
- 文本分析使用预先训练的句子嵌入和双向长期短期记忆 (BiLSTM).
- 音频分析采用主要组件分析 (PCA) 来减少维度和支持矢量机 (SVM) 来进行预测.
- 视频分析使用极端梯度提升 (XGBoost) 进行特征选择和检测.
- 一个集体投票算法将所有模式的输出结合起来,最终做出预测.
主要成果:
- 该模型在DAIC-WOZ数据集上获得0.85的加权F1评分.
- 性能指标包括5.57的根平均平方误差 (RMSE) 和4.48的平均绝对误差 (MAE).
- 拟议的多式联络模式在抑郁症检测和评估方面显著优于基线方法和现有的最先进方法.
结论:
- 开发的多式联接融合模型在自动抑郁检测和评估方面表现出卓越的性能.
- 这种方法为传统诊断方法提供了更客观,更强大的替代方案.
- 这些发现突出了整合多种数据模式以改善心理健康诊断的潜力.


