一个自然语言处理模型用于COVID-19检测基于荷兰通用实践电子健康记录,通过使用变压器的双向编码器表示:开发和验证研究研究
Maarten Homburg1, Eline Meijer1,2, Matthijs Berends1,3,4
1Department of Primary- and Long-Term Care, University Medical Center Groningen, Groningen, Netherlands.
Journal of medical Internet research
|October 4, 2023
概括
一个BERT模型准确地识别了荷兰一般实践电子健康记录中的COVID-19咨询,甚至在官方确认之前预测了病例. 这种自然语言处理方法为早期疾病监测和疫情检测提供了强大的工具.
科学领域:
- 计算语言学计算语言学
- 医疗信息学医学信息学
- 流行病学 流行病学
背景情况:
- 像BERT这样的自然语言处理 (NLP) 模型显示了从电子健康记录 (EHR) 改进疾病识别的潜力.
- COVID-19大流行突显了疾病监测的挑战,特别是非结构化EHR数据.
- 荷兰的全科医生电子健康记录包含有价值的信息,但由于自由文本条目,难以分析.
研究的目的:
- 开发和验证一个BERT模型,用于在荷兰一般实践EHR中检测COVID-19咨询.
- 评估模型在识别COVID-19病例中的准确性和可靠性.
主要方法:
- 一个BERT模型预先训练了荷兰语数据,并使用COVID-19和非COVID-19的全科医生咨询数据集进行了微调.
- 模型的性能在一个独立的测试集上进行了评估,并通过外部EHR数据,PCR测试结果和住院数据来验证.
- 这项研究利用了300359次全科医生咨询来开发模型.
主要成果:
- 开发的BERT模型实现了高精度 (0.97) 和F1得分 (0.90) 的COVID-19咨询检测.
- 外部验证显示了可比的高性能,而PCR验证显示了高回忆率,但精度和特异性较低.
- 该模型与COVID-19住院患者有显著的相关性,并且可以在荷兰首个确诊病例出现前几周预测病例.
结论:
- 经验证的BERT模型准确地识别了COVID-19病例在一般实践EHR中,甚至在确诊诊断之前.
- 这表明NLP模型在早期发现疾病爆发和有效监测疾病方面的潜力.
- 这项研究为使用类似模型用于早期识别各种疾病提供了蓝图.


