一个基于哥伦比亚-自杀严重性评级尺度的自然语言处理管道
medRxiv : the preprint server for health sciences
|January 7, 2025
概括
一个新的自然语言处理 (NLP) 算法准确地检测电子健康记录中的自杀念头 (SI) 和行为 (SB). 这种NLP方法显著优于传统的诊断代码,用于识别有风险的患者.
科学领域:
- 医疗信息学 医疗信息学
- 临床自然语言处理 临床自然语言处理
- 公共卫生监督 公共卫生监督
背景情况:
- 电子健康记录 (EHR) 在捕捉患者自杀倾向及其严重程度方面存在局限性.
- 现有的诊断代码 (ICD-9/10) 不足以对自杀风险进行详细评估.
研究的目的:
- 开发和验证一个便携式的自然语言处理 (NLP) 算法,用于在EHR数据中检测自杀念头 (SI) 和与自杀有关的行为/企图 (SB/SA).
- 为了比较NLP算法的性能与传统的疾病国际统计分类 (ICD) 诊断代码.
主要方法:
- 一个NLP算法是基于哥伦比亚-自杀严重性评级表 (C-SSRS) 标准设计的.
- 来自三个主要学术医疗中心的临床笔记被手动注释,以创建算法评估的"黄金标准".
- 使用F1分数评估算法的准确性,并将其检测率与不同人口群体的ICD代码进行比较.
主要成果:
- 在所有参与站点中,NLP算法实现了高准确度得分 (F1:0.86-0.97).
- 与ICD代码相比,NLP显示SB/SA (近30倍) 和SI (近10倍) 的检测率明显更高.
- 该算法没有显示与种族/种族相关的性能偏差,并且在精神病和非精神病电子健康记录中表现相似.
结论:
- 开发的NLP算法准确地识别和区分SI和SB/SA与临床笔记.
- 与当前的ICD编码实践相比,NLP显著提高了自杀风险的确定.
- 这种算法提供了一个更有效的工具,用于识别EHR系统中的有风险的个人,可能使ICD代码为此目的过时.


