自然语言处理算法在电子健康记录中识别野生类型的异酸脱酶质瘤
Noah Forrest1, Vijeeth Guggilla1, April Bell1
1Institute for Artificial Intelligence in Medicine, Feinberg School of Medicine, Northwestern University, Chicago, Illinois, USA.
Neuro-oncology advances
|July 24, 2025
概括
自然语言处理 (NLP) 在电子健康记录中有效地识别了野生型异酸脱酶 (IDHwt) 结质瘤的患者. 这种方法有助于对质母细胞瘤 (GBM) 的回顾性研究,因为它克服了世卫组织最新分类所带来的挑战.
科学领域:
- 在瘤学瘤学.
- 医疗信息学 医疗信息学
- 计算生物学 计算生物学
背景情况:
- 2021年世界卫生组织对质母细胞瘤 (GBM) 的重新分类,只包括异酸脱酶野生型质瘤 (IDHwt),这对回顾性患者鉴定提出了挑战.
- 现有的电子健康记录 (EHR) 数据经常使用过时的分类系统,使得IDHwt GBM队列的准确检索变得复杂.
- 自然语言处理 (NLP) 为从非结构化的临床笔记中提取特定的诊断和分子信息提供了一个潜在的解决方案.
研究的目的:
- 开发和验证NLP模型,使用EHR数据准确识别IDHwt质瘤患者.
- 评估这些NLP模型在多站点环境中的性能.
- 利用已识别的队列进行进一步的临床和生存分析.
主要方法:
- 手动判定1499个病理记录的IDHwt状态和MGMT促进剂甲基化.
- 训练正规化后勤回归模型使用NLP提取与IDH突变和MGMT促进者身份相关的生物医学概念.
- 在二级医疗机构验证开发的NLP模型.
- 构建卡普兰-梅尔曲线以分析基于MGMT促进体甲基化状态的生存率.
主要成果:
- 性能最好的NLP模型在识别IDHwt质瘤时获得了0.88的F1测量.
- 甲基化和非甲基化MGMT促进剂 (P < 0.001) 患者之间观察到总生存时间中位数的显著差异.
- 在二次部位验证时,IDHwt质瘤识别模型表现出高性能 (F1测量为0.962).
结论:
- NLP模型可以从EHR病理说明中可靠地识别IDHwt质瘤患者.
- 经过验证的模型适用于构建多个站点的GBM队列.
- 使用NLP处理的EHR数据是研究GBM生存趋势和临床特征的宝贵资源.


