基于大型语言模型的方法,以低成本,快速和准确地从荷兰病理学报告中自动提取预测生物标志物测试结果
Vincent D de Jager1, Michiel van der Ree2, Betzabel Cajiao Garcia1
1Department of Pathology and Medical Biology, University Medical Center Groningen, University of Groningen, Groningen, the Netherlands.
Virchows Archiv : an international journal of pathology
|November 29, 2025
概括
一个新的大型语言模型 (LLM) 准确地从肺癌病理学报告中提取生物标志物测试数据. 这使得对EGFR和KRAS测试进行高效,低成本的分析,以评估医疗保健质量.
科学领域:
- 在瘤学瘤学.
- 生物信息学是一种生物信息学.
- 医疗信息学 医疗信息学
背景情况:
- 国家癌症登记册和病理学数据库为医疗保健质量评估和观察性研究提供了有价值的现实数据.
- 从非结构化的病理学报告中手动提取信息是劳动密集型,昂贵且耗时的.
研究的目的:
- 开发和验证基于大型语言模型 (LLM) 的方法,从非小细胞肺癌 (NSCLC) 病理报告中提取生物标志物测试数据.
- 专门提取表皮生长因子受体 (EGFR) 和KRAS生物标志物测试和结果的数据.
主要方法:
- 来自荷兰癌症登记处 (NCR) 和Palga (荷兰病理学数据库) 的3887名转移性NSCLC患者的队列被用于培训和验证.
- 该LLM接受了手动捕获数据的培训,包括生物标志物测试状态,下一代测序 (NGS) 使用和特定突变结果.
- 模型性能使用测试集的 (微) F1 评分进行评估,并进一步在单独的队列上进行验证,并进行手动注释.
主要成果:
- 该LLM实现了高准确性,在初始测试组中 (微) F1得分≥0.98,在随后的验证队列中≥0.95.
- 该模型在识别阳性分子测试结果方面表现出色,在98.7% (KRAS) 和100.0% (EGFR) 的病例中正确记录突变.
- 对2022-2023年队列的分析显示,总体KRAS (88.1%) 和EGFR (86.4%) 测试率很高,测试患者中有40.5% (KRAS) 和11.5% (EGFR) 呈阳性结果.
结论:
- 基于LLM的方法可以准确有效地从肺癌病理学报告中提取生物标志物测试数据.
- 这种方法有助于在全国范围内快速,低成本地评估生物标志物检测率和结果.
- 该应用程序支持指南遵守评估和瘤学后期生物标志物后续研究.


