评估生成预训练变压器 (GPT) 模型在合成患者日记条目中的自杀风险评估
Dan Holley1, Brian Daly2, Briana Beverly3
1Clinical Operation, NeuroFlow, Philadelphia, PA, USA. dan@neuroflow.com.
BMC psychiatry
|August 1, 2025
概括
大型语言模型 (LLM) 可以有效地从数字日记条目中识别自杀风险,改善早期干预. 这种人工智能工具在评估自杀念头 (SI) 严重程度方面表现出很高的准确性,有助于自杀预防工作.
科学领域:
- 数字心理健康数字心理健康
- 医疗保健中的人工智能
- 计算精神病学是一种计算精神病学.
背景情况:
- 自杀是全球卫生危机,每年有超过70万人死亡.
- 从自杀念头 (SI) 到尝试的快速进展往往绕过了干预机会.
- 数字行为健康 (DBH) 平台收集潜在的SI指标,但手动审查是耗时的,可能会推迟护理.
研究的目的:
- 评估大型语言模型 (LLM) 在自动风险分层文本中对自杀念头 (SI) 严重性的有效性.
- 评估基于LLM的SI风险分层的性能与专家临床医生共识相比.
- 确定LLM在数字心理健康平台中简化干预决策的潜力.
主要方法:
- 创建了一个经过验证的125个合成期刊条目集体,SI存在和严重程度各不相同.
- 五位行为健康专家独立对风险进行了分层的日记条目 (没有,低,中等,高风险SI).
- 利用OpenAI的GPT模型的量身定制实现来对相同的库进行风险分层,并将结果与临床医生评级进行比较.
主要成果:
- 整体LLM获得了65.60%的确切风险评估协议与临床医生的共识,明显高于机会 (30.38%).
- 该LLM与92%的临床医生"干预/不干预"决策一致 (科恩的卡帕=0.84).
- 该模型在干预决策中显示出94%的灵敏度和91%的特异性,提高了速度和成本效益.
结论:
- 用LLM驱动的风险分层显示了作为预防自杀的工具的巨大潜力.
- 这项技术可以增强数字行为健康平台数据的实用性.
- 对LLM应用和伦理考虑进行进一步的研究是有必要的,以确保强大的实施.


