使用自然语言处理自动化临床表型化
Linea Schmidt1,2,3, Susanne Ibing4,5,6, Florian Borchert1,2,3
1Hasso Plattner Institute, Digital Engineering Faculty, University of Potsdam, Potsdam, Germany.
Communications medicine
|January 13, 2026
概括
像GPT-4这样的大型语言模型 (LLM) 在克罗恩病研究中显示出可计算的表型,匹配人类专家的性能. 这可以简化电子病历分析和患者队列研究.
科学领域:
- 医疗信息学 医疗信息学
- 计算生物学 计算生物学
- 健康 数据科学 数据科学
背景情况:
- 电子健康记录 (EHR) 分析患者表型通常是人工和劳动密集型的.
- 需要可扩展和自动化的方法来有效地从电子健康记录中提取临床信息.
研究的目的:
- 开发和比较基于规则 (spaCy) 和基于大型语言模型 (LLM) 的 (GPT-4) 可计算的表型化算法.
- 用临床叙事文本根据诊断时的年龄和疾病行为对克罗恩病患者进行亚表型.
主要方法:
- 使用spaCy进行基于规则的表型化和GPT-4用于基于LLM的表型化.
- 分析了来自584名克罗恩病患者的49,572份临床笔记和2204份放射学报告.
- 使用F1分数,回忆,精度和句子和患者水平的特异性来评估算法性能.
主要成果:
- GPT-4的性能与基于规则的方法相比或优于规则的方法.
- 注释级F1得分达到至少0.90的疾病行为和0.82的年龄在诊断时.
- 患者水平的F1得分至少为疾病行为0.66和诊断时的年龄0.71.
结论:
- 这是第一个比较LLM和基于规则的系统的研究,用于从临床文本中复杂的克罗恩病亚表型化.
- 与人类专家相比,LLM的表现没有显示出统计上的差异.
- LLM对大规模的EHR分析和简化图表审查流程具有重大潜力.


