一个顺序敏感的等级神经模型,用于早期肺癌检测,使用荷兰初级保健笔记和结构化数据
Iacopo Vagliano1,2, Miguel Rios1,2,3, Mohanad Abukmeil1,2
1Department of Medical Informatics, Amsterdam University Medical Centers, Meibergdreef 9, 1105 AZ Amsterdam, The Netherlands.
Cancers
|April 14, 2025
概括
使用自由文本笔记的新预测模型可以改善初级保健中早期肺癌检测. 这些模型利用单词和句子的上下文,显示出强大的性能和临床实践的潜力.
科学领域:
- 医疗信息学 医疗信息学
- 在瘤学瘤学.
- 自然语言处理自然语言处理.
背景情况:
- 及时检测肺癌对于改善患者的治疗结果至关重要.
- 初级保健机构提供了通过分析临床笔记进行早期诊断的机会.
- 利用非结构化文本数据可以增强预测模型.
研究的目的:
- 开发和验证用于早期肺癌检测的预测模型,使用自由文本咨询笔记.
- 评估包含单纯文本与与临床变量结合文本的模型的实用性.
- 在歧视,正预测值 (PPV) 和校准方面评估模型性能.
主要方法:
- 利用了来自一般实践的大量数据集 (2002-2021年),包括30岁以上的患者和自由文本笔记.
- 开发了使用注意力和双向长期短期记忆网络的层次模型.
- 在单独的数据集上训练并测试模型,不包括接近诊断的数据,并纳入临床变量.
主要成果:
- 组合模型 (文本+临床变量) 在测试组中实现了AUROC为0.91和AUPRC为0.05.
- 阳性预测值 (PPV) 为0.034,并观察到良好的校准.
- 鉴定一个肺癌患者需要对29名高风险个体进行额外的测试.
结论:
- 开发的模型通过分析文本结构,展示了早期肺癌检测的优秀歧视.
- 将临床变量与文本相结合,略提高了模型性能.
- 这些模型对临床实践充满希望,需要进一步的外部验证和实施研究.


