在自由形式的临床笔记中识别儿科长期COVID症状和功能影响的自然语言处理管道:RECOVER研究
H Timothy Bunnell1, Cara Reedy1, Vitaly Lorman2
1Biomedical Research Informatics Center, Nemours Children's Health, Wilmington, DE 19803, United States.
JAMIA open
|September 8, 2025
概括
一个新的自然语言处理 (NLP) 管道准确地识别使用电子健康记录的儿童的长期COVID症状和功能影响. 这种方法增强了对儿科长期COVID的理解,改善了患者的表征.
科学领域:
- 儿科健康 儿科健康
- 医疗信息学 医疗信息学
- 自然语言处理自然语言处理.
背景情况:
- 长期COVID在儿科患者群体中构成了重大挑战,症状和功能影响通常在电子健康记录 (EHR) 中表现不佳.
- 电子健康记录中的非结构化临床笔记包含有价值的数据,用于理解复杂的疾病,如儿科长期COVID.
- 现有的方法可能无法完全捕捉儿童长期COVID的细微差别,需要先进的分析方法.
研究的目的:
- 开发和验证一种自然语言处理 (NLP) 管道,以从非结构化的EHR数据中提取儿科患者长期COVID的症状和功能影响.
- 为了比较长期COVID诊断的和没有长期COVID诊断的儿科患者之间确定的长期COVID概念的流行率.
主要方法:
- 分析了来自12个机构的10,618名儿科患者的48,287份门诊进展记录,重点关注COVID诊断后28至179天的记录.
- 开发一个NLP管道,以确定21个症状和4个与长期COVID相关的功能影响类别.
- 由主题专家 (中小企业) 验证NLP管道,并比较长期COVID和急性COVID队列之间的概念流行率.
主要成果:
- 该NLP管道显示了中等准确性 (F1 = .80),改进到高准确性 (F1 = .90),具有高信心的SME断言.
- 与急性COVID队列相比,在假定的长期COVID队列中,已识别的25个长期COVID概念类别的流行率明显高于急性COVID队列.
- 从临床笔记与结构化EHR数据中识别的概念中观察到差异,突出了非结构化数据的价值.
结论:
- 将NLP纳入非结构化EHR数据的分析,为儿童长期COVID综合征提供了关键的见解.
- 开发的NLP方法对于创建可计算的表型和准确地描述长期COVID的儿童是有价值的.
- 这种方法强调了利用先进的NLP技术来提高对儿科长期COVID的理解和管理的重要性.


