一种深度学习方法,用于电子健康记录中的跨性别和性别多样性患者识别
Yining Hua1, Liqin Wang2, Vi Nguyen2
1Division of General Internal Medicine and Primary Care, Department of Medicine, Brigham and Women's Hospital and Harvard Medical School, Boston, MA, USA; Department of Epidemiology, Harvard T.H Chan School of Public Health, Boston, MA, USA; Department of Biomedical Informatics, Harvard Medical School, Boston, MA, USA.
Journal of biomedical informatics
|October 1, 2023
概括
这项研究开发了一种使用自然语言处理 (NLP) 的深度学习模型,用于在电子健康记录 (EHR) 中准确识别患者的性别身份,从而改善对跨性别和性别多样性 (TGD) 个人的护理.
科学领域:
- 医疗信息学 医疗信息学
- 自然语言处理自然语言处理.
- 机器学习 机器学习
背景情况:
- 在电子健康记录 (EHR) 中准确识别性别身份对于公平的医疗保健至关重要,特别是对于跨性别和性别多样性 (TGD) 的人群.
- 电子健康记录中的结构化数据不完整,对确定患者的性别认同构成重大挑战.
研究的目的:
- 利用NLP和深度学习开发一个准确的患者性别认同预测模型.
- 解决从EHR数据中提取患者级信息的挑战,并减少手动注释工作.
- 用TGD识别作为一个案例研究来改善电子健康记录中的性别认同.
主要方法:
- 从专家的意见,文献审查和BioWordVec模型扩展中策划了一个关键词列表,以确定临床笔记中的相关性别信息.
- 创建了两个数据集:数据集I (平衡的,临床医生确认的TGD患者和对照组) 和数据集II (以关键词进行丰富).
- 在这些数据集上训练并验证了一个深度学习模型,其性能与传统的机器学习和基于规则的算法相比较.
主要成果:
- 最终的关键词列表包括109个术语,其中53.2%通过BioWordVec扩展添加.
- 数据集I包括3,150名患者 (50%的TGD),数据集II包括200名患者 (90%的TGD).
- 深度学习模型实现了高性能:F1分数为0.917 (数据集I) 和0.969 (数据集II),显著优于基于规则的方法.
结论:
- 这项研究证明了深度学习集成NLP算法的有效性,用于从EHR数据中准确识别性别认同.
- 开发的模型显示了改善TGD个人的医疗保健公平的希望.
- 未来的研究应该探索多样化的数据源,以提高算法概括性.


