对乳腺癌表型化NLP算法在电子健康记录上的跨机构评估
Sicheng Zhou1, Nan Wang2, Liwei Wang3
1Institute for Health Informatics, University of Minnesota, Minneapolis, MN, USA.
Computational and structural biotechnology journal
|September 8, 2023
概括
基于变压器的临床NLP模型CancerBERT在提取乳腺癌表型方面表现出卓越的概括性和性能,与不同机构的传统模型相比. 这凸显了它在更广泛的临床应用中的潜力.
科学领域:
- 临床自然语言处理 (NLP)
- 医疗保健中的机器学习
- 生物医学信息学 生物医学信息学
背景情况:
- 基于变压器的语言模型越来越多地用于临床NLP.
- 不同临床机构的模型通用性经常被忽视.
- 在现实世界中,评估CancerBERT在多机构环境中的表现至关重要.
研究的目的:
- 评估CancerBERT与经典NLP模型 (CRF,BiLSTM-CRF) 的通用性.
- 在两个不同的临床研究所评估乳腺癌表型提取任务的模型性能.
- 为了比较模型转移学习与本地培训策略.
主要方法:
- 来自明尼苏达大学 (UMN) 和梅奥诊所 (MC) 的收集和注释的临床体.
- 开发并训练了三个NLP模型:CRF,BiLSTM-CRF和CancerBERT.
- 通过独立的测试集和排列测试评估模型通用性,评估实体覆盖范围和微型F1分数.
主要成果:
- 在UMN和MC的独立测试集中,CancerBERT实现了最佳性能.
- 在第二个研究所微调的CancerBERT模型与当地训练的模型 (微F1:0.925对0.932) 的性能相当.
- 两所研究所的临床实体对目标实体的相似性比整体实体更高.
结论:
- 癌症BERT在临床命名实体识别任务中表现出卓越的学习能力和概括性.
- 该模型有效地识别复杂的实体,包括那些有各种标签的实体.
- 这些发现支持CancerBERT在多机构临床NLP应用中具有强大的性能潜力.
更多相关视频
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
8.3K
07:15Machine Learning Algorithms for Early Detection of Bone Metastases in an Experimental Rat Model
Published on: August 16, 2020
6.8K
