从西班牙瘤病理学报告的自由文本中自动提取信息
Diana Marcela Mendoza-Urbano1, Johan Felipe Garcia2, Juan Sebastian Moreno2,3
1Universidad Nacional de Colombia, Facultad de Medicina, Departamento de Patología, Bogotá, Colombia.
Colombia medica (Cali, Colombia)
|August 24, 2023
概括
这项研究开发了一种自然语言处理算法,从西班牙病理学报告中提取瘤信息. 该算法取得了令人满意的结果,证明了其提高癌症注册表数据质量的潜力.
科学领域:
- 自然语言处理自然语言处理.
- 医疗信息学 医疗信息学
- 在瘤学瘤学.
背景情况:
- 病理学报告是无结构的,导致大量的人为瘤信息提取所付出的努力.
- 高质量的数据记录对于医院癌症注册表至关重要.
研究的目的:
- 实施一种自然语言处理 (NLP) 算法,从瘤病理学报告中提取医学描述符.
- 描述了为西班牙病理学报告开发和验证NLP算法的过程.
主要方法:
- 开发了一种西班牙NLP算法,使用连续的正则表达式巧合提取20个医学描述符.
- 在140个病理学报告中验证了对人类提取的算法,评估了地形和形态识别.
主要成果:
- 该算法在识别形态学方面取得了高准确度 (89.5%的得分),在地形学方面取得了令人满意的结果 (68.3%的得分).
- 初步验证显示,正则表达式方法准确地从自由文本报告中提取样本属性.
结论:
- 基于正则表达式的NLP算法可以有效地从西班牙病理学报告中提取医疗属性.
- 开发的算法显示了改善癌症登记处数据质量的前景.
- 创建了一个合作验证网站,以促进更大规模的研究.


