法国电子医疗记录的自动去识别:利用远程监督和深度学习模型的成本效益高的方法
Mohamed El Azzouzi1, Gouenou Coatrieux2, Reda Bellafqira2
1Univ Rennes, INSERM, LTSI-UMR 1099, F-35000, Rennes, France. mohamed.elazzouzi@univ-rennes.fr.
BMC medical informatics and decision making
|February 16, 2024
概括
这项研究开发了一种使用远程监督的临床文档自动化非识别管道,大大降低了手动注释成本. 先进的NLP方法有效地保护用于研究的电子健康记录中的敏感健康信息.
科学领域:
- 在医疗保健中的自然语言处理 (NLP)
- 医疗信息学 医疗信息学
- 数据隐私和安全数据隐私和安全
背景情况:
- 电子健康记录 (EHR) 丰富的临床研究数据,但由于敏感的患者信息,会带来安全挑战.
- 消除电子人权的身份识别对于保护个人数据和遵守法规至关重要.
- 目前基于深度学习的命名实体识别 (NER) 方法需要广泛的手动注释,这是昂贵和耗时的.
研究的目的:
- 使用远程监督方法开发临床文件的自动非识别管道.
- 显著降低与手动数据注释相关的成本和工作量.
- 为了促进无标识管道的可转移到其他临床中心,并促进EHR重复用于研究.
主要方法:
- 开发了一种用于法国临床非识别的自动注释过程,利用来自eHOP临床数据仓库 (CDW) 和国家知识库的数据.
- 使用Prodigy工具实现了辅助数据注释解决方案,以降低创建参考库的成本.
- 评估了各种命名实体识别 (NER) 方法,包括带有Flair+FastText字嵌入的Bi-LSTM+CRF架构.
主要成果:
- 从雷恩大学医院的EHR创建了一个法国的非识别数据集,显示在培训和测试集中类似的实体分布.
- 在手动注释的临床报告中,Bi-LSTM+CRF模型获得了96.96%的显著F1得分.
- 结果表明,自动删除识别方法在识别和删除敏感信息方面的有效性.
结论:
- 成功开发了临床笔记的自动取消识别管道,使电子健康记录能够被用于临床研究等次要目的.
- 这项研究强调了先进的NLP技术的重要性,例如远程监控,以有效地消除身份.
- 需要创新的解决方案来应对医疗领域有限的注释数据的挑战,用于去识别任务.


