从非结构化的电子健康记录中自动提取中风严重程度,使用自然语言处理
Marta Fernandes1, M Brandon Westover2, Aneesh B Singhal1
1Department of Neurology Massachusetts General Hospital (MGH) Boston MA.
Journal of the American Heart Association
|October 25, 2024
概括
一个新的自然语言处理模型准确地从电子健康记录中提取和预测国家卫生研究院中风量表的得分,改善中风研究. 该工具增强了中风严重程度的表型化,用于质量改进和比较有效性研究.
科学领域:
- 神经学 神经学
- 医疗信息学 医疗信息学
- 人工智能的人工智能
背景情况:
- 电子健康记录 (EHR) 对中风研究有价值,但在数据抽象和缺失信息方面面临挑战.
- 准确的中风严重程度评估对于质量改善和比较有效性研究至关重要.
- 现有的方法很难从电子健康记录中可靠地提取或预测国家卫生研究院中风量表 (NIHSS) 的得分.
研究的目的:
- 开发和验证一种自然语言处理 (NLP) 模型,用于从EHR临床笔记中提取和预测NIHSS得分.
- 为了克服EHR数据抽象中风严重程度评估的局限性.
- 为了促进大规模的中风严重程度的表型化.
主要方法:
- 一个两阶段的NLP模型是使用最小绝对收缩和选择操作员 (LASSO) 回归开发的.
- 第1阶段使用正则表达式来提取记录的NIHSS分数.
- 第二阶段使用LASSO来预测NIHSS从临床文档中的得分,当得分缺失时.
- 该模型在麻省总医院的数据上进行了训练和测试,并在MIMIC数据库上进行了验证.
主要成果:
- 该模型在训练/测试集 (RMSE: 2.89,斯皮尔曼相关性: 0.92) 和验证集 (RMSE: 2.20,斯皮尔曼相关性: 0.96) 中都实现了高精度.
- 该NLP模型在提取记录的NIHSS分数和预测缺失分数方面表现强.
- 该研究包括两个大型数据集的4000多名患者.
结论:
- 开发的NLP模型使得自动化,大规模的中风严重程度的表型化从EHRs.
- 这种方法可以显著提高现实世界的质量改善和中风的比较有效性研究.
- 该模型提供了一种可靠的方法来克服基于EHR的中风研究中的数据限制.


