利用自然语言处理从乳腺癌病理学报告中有效提取信息:单一机构研究
Phillip Park1,2, Yeonho Choi2, Nayoung Han3
1Department of Digital Health, Samsung Advanced Institute for Health Sciences and Technology, Sung Kyun Kwan University, Seoul, Korea.
PloS one
|February 18, 2025
概括
自然语言处理 (NLP) 模型,特别是BioBERT,在从乳腺癌病理报告中提取数据时,与传统正则表达式相比,显示出更高的准确性. 这一进步提高了对关键诊断信息的分析.
科学领域:
- 在瘤学瘤学.
- 医疗信息学 医疗信息学
- 计算语言学 计算语言学
背景情况:
- 准确的病理学报告对于乳腺癌的诊断和治疗至关重要.
- 乳腺癌是影响女性的全球领先癌症.
研究的目的:
- 为了比较正则表达式和自然语言处理 (NLP) 的准确性,从乳腺癌病理报告中提取数据.
- 为了完成这项任务,评估不同的NLP模型,包括BERT变体.
主要方法:
- 利用了1,215份乳腺癌病理报告用于NLP模型开发.
- 通过k-fold交叉验证训练和评估了三个BERT模型 (BERT-基本,BioBERT,临床BERT).
- 将NLP模型性能与使用命名实体识别 (NER) 的正则表达式进行比较.
主要成果:
- 在评估的NLP模型中,BioBERT实现了最高的准确性 (平均性能=0.99901,k=5).
- 与其他BERT模型相比,BioBERT在所有报告项目中显示出较低的错误率 (准确度≥0.9).
- 在提取诸如导管内部部件,淋巴结状况和淋巴血管入侵等关键项目的过程中,BioBERT显著优于常规表达式.
结论:
- 对于处理乳腺癌病理学报告,NLP模型 BioBERT 的准确性高于常规表达式.
- 生物BERT的卓越性能凸显了其在对瘤病理学数据的自动化分析中的重要性.


