从病理学报告与外部验证中对TNM阶段的可概括和自动分类
Jenna Kefeli1, Nicholas Tatonetti1,2,3,4
1Department of Systems Biology, Columbia University, New York, NY, USA.
medRxiv : the preprint server for health sciences
|July 10, 2023
概括
我们开发了一种自动化方法,从病理学报告中分类TNM癌症阶段. 这种人工智能模型即使没有明确声明,也能准确地推断出癌症的阶段,从而提高了癌症数据的可访问性.
科学领域:
- 在瘤学瘤学.
- 医疗信息学 医疗信息学
- 自然语言处理自然语言处理.
背景情况:
- 癌症分期,特别是TNM分期,对于患者的预后和临床试验资格至关重要.
- 在结构化的电子健康记录中,TNM阶段往往没有被系统地记录,这阻碍了数据分析和临床决策.
研究的目的:
- 从非结构化病理报告文本直接开发和验证一种可通用的方法,用于自动化TNM阶段分类.
- 创建一个能够从上下文信息推断TNM阶段的模型,当明确的提及缺席时.
主要方法:
- 基于BERT的深度学习模型在23种癌症类型的大约7,000份公开可用的病理学报告的大数据集上进行了训练.
- 优化了模型架构,输入大小和参数,以提高分类性能.
- 外部验证是使用哥伦比亚大学医学中心近8,000份病理学报告进行的.
主要成果:
- 经过训练的基于BERT的模型在从病理报告中对TNM阶段进行分类方面表现出了强的表现.
- 在外部验证过程中,该模型在接收器操作特征曲线 (AU-ROC) 下实现了高面积,范围为0.815至0.942.
- 该模型成功地从上下文线索中推断出TNM阶段,超出了简单的关键字提取.
结论:
- 开发的自动化方法为从病理学报告中提取TNM癌症阶段提供了可通用的方法.
- 该模型从上下文中推断阶段的能力使其在不同机构中广泛适用,而不需要广泛的微调.
- 这项技术有可能提高癌症分期数据的可访问性和利用性,用于临床护理和研究.


