从急诊室的临床笔记中识别出尿路感染的迹象和症状,使用大型语言模型
Mark Iscoe1,2, Vimig Socrates2,3, Aidan Gilson4
1Department of Emergency Medicine, Yale School of Medicine, New Haven, Connecticut, USA.
概括
大型语言模型 (LLM) 在电子健康记录 (EHR) 中有效地识别尿路感染 (UTI) 症状. 基于变压器的模型在检测急诊室笔记中的尿路感染症状方面显示出高准确度.
科学领域:
- 医疗信息学 医疗信息学
- 自然语言处理自然语言处理.
- 医疗保健中的人工智能
背景情况:
- 自然语言处理 (NLP) 工具,包括大语言模型 (LLM),为分析医疗保健中的非结构化文本提供了潜力,例如电子健康记录 (EHR) 注释.
- 从EHR中提取患者的症状和症状对于研究和临床支持至关重要,但历史上一直具有挑战性.
研究的目的:
- 为紧急医学研究社区介绍NLP的基础知识,包括术语,注释和模型培训/评估.
- 开发和比较两个NLP模型来识别尿路感染 (UTI) 症状从非结构化的急诊部 (ED) 笔记.
主要方法:
- 一个数据集由1250个ED临床医生笔记,来自18岁以上的尿液分析患者,对17个尿路感染症状进行了注释.
- 开发了两个特定任务的LLM:基于卷积神经网络的模型 (SpaCy) 和基于变压器的模型 (临床长变压器).
- 模型在1000个笔记上接受训练,在250个笔记上进行测试,比较在笔记级别识别尿路感染症状方面的表现.
主要成果:
- 在1250张纸币中共发现了8135个实体 (症状),其中83.6%的纸币包含至少一个实体.
- 基于变压器的临床长变压器模型与SpaCy模型 (0.84) 相比,实现了更高的整体F1测量 (0.88).
- 为了在临床说明中确定任何尿路感染症状的存在或不存在,SpaCy模型实现了0.96 F1,Longformer模型实现了0.98 F1.1.
结论:
- LLM,特别是基于变压器的模型,对于从非结构化的ED临床笔记中提取UTI症状是有效的.
- 开发的模型在标记级别上检测任何尿路感染症状的存在或不存在方面表现出高准确性.
- 对于识别个人尿路感染症状的表现有所不同.


