深度学习模型用于选乳腺和结肠直肠癌进展的电子健康记录:绩效评估研究研究
Pascal Lambert1,2, Rayyan Khan1,3, Marshall Pitz1,4,5,6
1Paul Albrechtsen Research Institute CancerCare Manitoba, Winnipeg, MB, Canada.
JMIR AI
|October 13, 2025
概括
深度学习语言模型有效地识别了电子健康记录 (EHR) 中的癌症进展,大大减少了手动图表审查的需要. 临床-BigBird和临床-Longformer在检测乳腺癌和结直肠癌进展方面表现出卓越的表现.
科学领域:
- 计算语言学计算语言学
- 在瘤学瘤学.
- 医疗信息学 医疗信息学
背景情况:
- 癌症进展是研究中的一个关键结果,通常被埋在非结构化的电子健康记录 (EHR) 文本中.
- 手动查看图表以提取这些数据是耗时且昂贵的.
研究的目的:
- 评估三种深度学习语言模型在EHR中识别乳腺和结直肠癌进展的有效性.
- 为了比较Bio+ClinicalBERT,Clinical-BigBird和Clinical-Longformer模型的性能.
主要方法:
- 对乳腺癌和结直肠癌4期患者 (2004-2020) 的电子健康记录进行了回顾性分析.
- 使用预训练的深度学习模型 (Bio+ClinicalBERT,临床-BigBird,临床-Longformer) 来进行数据分析.
- 使用灵敏度,正预测值,AUC和缩放的Brier分数评估模型性能;确定了有影响力的代币.
主要成果:
- 临床-BigBird和临床-Longformer在两种癌症类型中都表现出比Bio+ClinicalBERT更高的准确性和灵敏度.
- 所有模型都成功地将图表审查工作量减少了84%以上.
- 术语"进展"被确定为模型预测中具有高度影响力的代币.
结论:
- 深度学习模型可以自动识别EHR中的癌症进展,大大减少手动审查工作.
- 通过更大的训练数据集和句子级EHR分析,可以提高模型性能.
- 了解有影响力的代币是完善模型解释性和准确性的关键.

