深度学习转换器模型用于构建一个全面的实时创伤观测站:开发和验证研究
Gabrielle Chenais1, Cédric Gil-Jardiné1,2, Hélène Touchais1
1Unit 1219, Bordeaux Public Health Center, Institut National de la Santé et de la Recherche Médicale, Bordeaux, France.
JMIR AI
|June 14, 2024
概括
自动化自然语言处理 (NLP) 模型,特别是变压器,在对公共卫生监测的非结构化临床记录进行分类方面表现出高效率. GPTanam变压器模型在从电子健康记录中识别创伤病例方面取得了最佳表现.
科学领域:
- 医疗信息学 医疗信息学
- 自然语言处理自然语言处理.
- 公共卫生监督 公共卫生监督
背景情况:
- 公共卫生监测需要及时收集数据.
- 自然语言处理 (NLP) 的进步使得从电子健康记录 (EHR) 中自动提取信息成为可能.
研究的目的:
- 评估法国国家创伤观察中心的可行性.
- 为了比较非结构化临床笔记的多类分类NLP方法.
主要方法:
- 利用了来自法国急诊部 (2012-2019) 的69,110份临床笔记.
- 手动注释的笔记用于创伤分类 (32.5%的患病率).
- 训练了4个变压器模型,并将它们与SVM的TF-IDF进行了比较.
主要成果:
- 变压器模型的性能优于SVM的TF-IDF.
- 在GPTanam变压器模型中,在法语语体上进行了预训练,并通过自我监督学习进行了微调,实现了最高的性能 (微F1得分为0.969).
结论:
- 变压器模型对于临床叙述数据的多类分类是有效的.
- 未来的工作应该涉及缩写扩展和多输出分类.


