开发一种机器学习模型,从乳腺癌病理学报告中自动提取数据
Christy Oi Ting Kwok1, Gregory Arbour2, Annah Zhang1
1Department of Surgery, Faculty of Medicine, University of British Columbia, 2221 Wesbrook Mall, Vancouver, BC, V6T 2B5, Canada.
Scientific reports
|November 13, 2025
概括
使用自然语言处理 (NLP) 自动化乳腺癌病理报告分析显著提高了数据提取的准确性. 一个PubMedBERT模型实现了97.4%的准确性,超过了以前的临床研究方法.
科学领域:
- 医疗信息学 医疗信息学
- 计算生物学 计算生物学
- 瘤学研究研究
背景情况:
- 从医疗记录中手动提取数据是耗时且容易出现错误的.
- 自然语言处理 (NLP) 和机器学习 (ML) 为自动化临床数据提取提供了潜力.
- 从乳腺癌病理学报告中准确地提取临床病理学特征对于研究和患者的结果至关重要.
研究的目的:
- 开发和评估NLP管道,从乳腺癌病理学报告中自动提取数据.
- 为了比较不同的NLP模型的性能,包括ClinicalBERT,PubMedBERT,BioMedRoBERTa和Mistral-Nemo LLM.
- 评估预训练对SQuAD问答数据集的影响,以提高模型准确性.
主要方法:
- 通过从四个候选人中选择表现最佳的模型来构建一个NLP管道.
- 模型对1795份乳腺癌病理报告进行了评估.
- 基于BERT的模型使用SQuAD数据集进行了进一步的预训练.
- 模型性能通过将提取的数据与人类注释进行比较来量化.
主要成果:
- 在SQuAD上进行预训练的PubMedBERT实现了最高的整体准确率97.4%.
- 在32个感兴趣领域 (FOI) 中,有30个显示精度超过95.0%.
- 开发的NLP模型的性能优于以前基于规则的算法 (95.6%的准确性).
结论:
- 一个高性能的问答NLP管道可以自动从乳腺癌病理学报告中提取临床病理学特征.
- 这种自动化方法为高可靠性数据提取提供了可扩展的解决方案,提高了研究效率.
- 改进的数据提取可以有助于改善乳腺癌护理的临床结果.
更多相关视频
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
8.6K
05:33Introduction of an Integrated Pathology Image Management, Artificial Intelligence, and Reporting System
Published on: July 11, 2025
773
