评估基于人工智能的交互评估使用大型语言模型进行抑郁查的有效性:开发和可用性研究
Zheng Jin1, Jiaxing Hu2, Dandan Bi1
1International Joint Laboratory of Behavior and Cognitive Science, Zhengzhou Normal University, Zhengzhou, Henan, China.
JMIR formative research
|January 13, 2026
概括
这项研究表明,使用大型语言模型进行自动抑郁症评估是可行的,与传统方法相比,显示出高准确性和用户满意度.
科学领域:
- 心理评估 心理评估 心理评估
- 自然语言处理 (NLP) 是一种自然语言处理.
- 医疗保健中的人工智能 (AI)
背景情况:
- 心理评估的传统评级尺度已经使用了一个多世纪了.
- 大型语言模型 (LLM) 为改变心理评估提供了新的潜力.
- 这项研究解决了评估抑郁症状的新方法的需要.
研究的目的:
- 开发和验证抑郁症状的自动评估范式.
- 将NLP与心理评估的传统测量工具相结合.
- 探索基于LLM的工具在临床实践中的可行性.
主要方法:
- 115名参与者完成了一个定制的ChatGPT接口,用于贝克抑郁症清单快速屏幕 (BDI-FS-GPT) 和患者健康问卷-9 (PHQ-9).
- 统计分析包括斯皮尔曼相关性,Cohen κ用于诊断一致性,以及曲线下的面积 (AUC) 用于准确性.
- 在自动化工具PHQ-9和临床诊断之间进行了比较.
主要成果:
- BDI-FS-GPT显示了与PHQ-9分数的中等相关性以及与临床诊断的实质性一致性 (κ=0.72).
- 该自动化工具实现了卓越的诊断准确性 (AUC=0.953),超过了PHQ-9 (AUC=0.859).
- 参与者报告说,他们对自动化评估的满意度明显更高.
结论:
- 集成NLP的自动化评估范式显示了心理评估的初步可行性.
- 这种方法将交互性和个性化与心理测量严谨性相结合.
- 随着LLM技术的进步,在更大,更多样化的研究中进一步验证是有必要的.
