开发和验证一种自然语言处理算法,用于从病理学报告中提取乳腺癌的临床和病理特征
Elisabetta Munzone1, Antonio Marra2, Federico Comotto3
1Division of Medical Senology, European Institute of Oncology IRCCS, Milan, Italy.
JCO clinical cancer informatics
|August 13, 2024
概括
这项研究开发了一种自然语言处理 (NLP) 模型,从病理学报告中提取乳腺癌 (BC) 数据. 先进的命名实体识别 (NER) -NLP模型实现了97.8%的准确性,提高了临床研究能力.
科学领域:
- 在瘤学瘤学.
- 医疗信息学 医疗信息学
- 人工智能的人工智能
背景情况:
- 电子健康记录 (EHR) 是乳腺癌 (BC) 研究的现实数据的丰富来源.
- 从非结构化的EHR中提取结构化数据,特别是病理学报告,是一项挑战.
- 自然语言处理 (NLP) 为自动化数据提取提供了一个潜在的解决方案.
研究的目的:
- 开发和评估NLP模型,从BC病理报告中提取结构化数据.
- 将基于规则的NLP算法的性能与命名实体识别 (NER) -NLP模型进行比较.
- 促进为临床研究创建全面的BC数据库.
主要方法:
- 最初的开发使用基于规则的NLP算法对193个BC病理报告 (2012-2016) 进行了开发.
- 数据提取变量与数据专家和瘤学家的手动提取进行了比较.
- 一个随后的NER-NLP模型在513个报告的扩展数据集上使用K-fold交叉验证进行了训练和验证.
主要成果:
- 基于规则的NLP算法与瘤学家达到了82.9%的一致性.
- 数据专家手动提取显示了90.8%与瘤学家的一致性.
- 对于ER,PR,HER2和Ki-67.7等关键生物标志物,NER-NLP模型显示了高准确度 (97.8%),性能完美 (F1得分1.0).
结论:
- 开发的NLP模型显示了加速创建癌症数据库的巨大潜力.
- 从电子健康记录中采用人工智能驱动的数据提取可以增强临床研究并支持瘤学倡议.
- 进一步的后处理旨在将提取的数据组织成可用于研究和临床应用的表格格式.
更多相关视频
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
8.2K
07:41Performing Data Mining And Integrative Analysis Of Biomarker in Breast Cancer Using Multiple Publicly Accessible Databases
Published on: May 17, 2019
8.9K
