从语音数据中进行心理健康诊断,使用卷积神经网络和视觉转换器
Rafiul Islam1, Md Taimur Ahad2, Faruk Ahmed1
14IR Research Cell, Daffodil International University, Dhaka, Bangladesh.
Journal of voice : official journal of the Voice Foundation
|November 16, 2024
概括
集结卷积神经网络和视觉转换器的深度学习模型使用语音分析准确地识别心理健康状况. 这种方法对推进计算机辅助精神健康诊断的前景充满希望.
科学领域:
- 计算语言学 计算语言学
- 精神病学是一个精神病学.
- 人工智能的人工智能
背景情况:
- 人的声音特征可以作为心理健康状况的指标.
- 通过技术进步,现有的心理健康诊断方法可以得到加强.
- 先进的深度学习模型的整合为客观的心理健康评估提供了新的途径.
研究的目的:
- 通过语音分析调查结合卷积神经网络和视觉转换器用于心理健康识别的有效性.
- 开发和评估一个深度学习模型,根据声乐生物标志物来区分稳定和不稳定的心理健康状况.
- 为心理健康领域的计算机辅助诊断领域做出贡献.
主要方法:
- 从孟加拉国精神卫生机构收集了稳定和不稳定精神健康状况的个人的语音数据.
- 开发了一种混合深度学习模型,集成卷积神经网络和视觉变压器,用于语音分析.
- 模型的性能使用准确性,精度,回忆和F1分数等指标进行评估.
主要成果:
- 拟议的模型实现了高性能,总体准确率为91%.
- 具体的性能指标包括"不稳定"类别的精度为92%",稳定"类别的精度为90%.
- 召回达到"稳定"类别的91%,"不稳定"类别的92%,F1得分为91%.
结论:
- 卷积神经网络和视觉转换器在语音分析中的集成表明了准确的心理健康识别的巨大潜力.
- 深度学习模型为计算机辅助诊断提供了一个有前途的工具,提高了心理健康评估的客观性和可访问性.
- 这项研究强调了深度学习对推进心理健康护理和诊断的重大影响.


