在电子健康记录中对心理健康预测模型进行非结构化文本的分类:大型语言模型评估研究
Nicholas C Cardamone1, Mark Olfson2, Timothy Schmutte3
1Department of Psychiatry, Perelman School of Medicine, University of Pennsylvania, Philadelphia, PA, United States.
JMIR medical informatics
|January 26, 2025
概括
大型语言模型 (LLM) 显示了与临床医生在电子健康记录 (EHR) 术语分类方面的高度一致. 虽然LLM为预测模型的手动编码提供了有希望的替代方案,但在对特定的心理和身体健康术语进行分类方面存在差异.
科学领域:
- 人工智能在医学中的应用
- 临床信息学 临床信息学
- 自然语言处理自然语言处理.
背景情况:
- 电子健康记录 (EHR) 数据对于医疗预测模型至关重要,可以识别诸如再入院等风险.
- 大型语言模型 (LLM) 可以将非结构化的EHR文本结构化为这些模型的可解释特征.
研究的目的:
- 为了比较最先进的LLM与临床专家的分类准确性.
- 为了评估LLM的表现,从EHR数据中对应急诊所 (ED) 的精神健康患者的术语进行分类.
主要方法:
- 从超过600万次ED情节 (2016-2021) 中提取了临床术语,用于50多个美国医疗保健机构的心理健康相关访问.
- 两个心理健康临床医生就术语和诊断代码分类达成共识.
- 评估了与临床医生的LLM协议,将术语分为"精神健康"/"身体健康"和42个 (精神) 或19个 (身体) 具体类别.
主要成果:
- 在LLM和临床医生之间,关于"心理健康"与"身体健康"的广泛分类,达成高度一致 (κ=0.77).
- 在特定心理健康 (κ=0.62) 和身体健康 (κ=0.69) 术语类别的LLM-临床医生协议中观察到相当大的变化.
结论:
- 在预测模型中,LLM显示出强大的潜力,可以作为手动编码的替代方案,用于生成可解释的特征.
- 虽然LLM协议对于一般类别来说很高,但在特定的精神和身体健康术语中的细微分类需要进一步细化.


