从非结构化电子健康记录中自动提取中风严重程度,使用自然语言处理
Marta Fernandes1, M Brandon Westover2, Aneesh B Singhal1
1Department of Neurology, Massachusetts General Hospital (MGH), Boston, Massachusetts, United States.
medRxiv : the preprint server for health sciences
|April 1, 2024
概括
这项研究开发了一种自然语言处理 (NLP) 模型,自动从电子健康记录 (EHR) 中确定国家卫生研究院中风量表 (NIHSS) 的得分. 该模型准确地提取中风严重程度数据,有助于质量改进和研究.
科学领域:
- 生物医学信息学 生物医学信息学
- 自然语言处理自然语言处理.
- 脑卒中研究 脑卒中研究
背景情况:
- 电子健康记录 (EHR) 为中风治疗研究提供了潜力,但面临着非结构化数据和缺失信息的挑战.
- 准确的中风严重程度评估对于质量改善和比较有效性研究至关重要.
研究的目的:
- 开发和验证一种自然语言处理 (NLP) 模型,用于在急性中风患者中自动确定国家卫生研究院中风量表 (NIHSS) 评分.
- 克服手动数据提取的局限性,以及用于中风研究的EHR中缺少的数据.
- 通过使用EHR数据实现可扩展的中风严重程度表型.
主要方法:
- 一个两阶段的NLP模型是使用马萨诸塞州总医院 (MGH) (2015-2022) 的电子健康记录来开发的.
- 第1阶段使用正则表达式来提取记录的NIHSS分数;第2阶段使用LASSO线性模型来预测未记录病例的NIHSS.
- 该模型在70%的MGH数据上进行了训练,并对30%进行了测试,然后在MIMIC-III数据集上验证.
主要成果:
- 这项研究包括4,163名急性中风患者 (MGH:3,876;MIMIC-III:287).
- 在两阶段的NLP模型中,在MGH测试组中,实现了根平均平方误差 (RMSE) 3.13和斯皮尔曼相关性 (SC) 0.90.
- 在MIMIC-III数据集中的验证显示RMSE为2.01和SC为0.96.9的性能有所改善.
结论:
- 基于NLP的模型使得从EHR数据中大规模的中风严重程度的表型化成为可能.
- 促进现实世界质量改善举措和中风护理中的比较有效性研究.


