开发和验证一个可通用的机器学习算法来识别间歇性肺病队列:一个回顾性队列研究
Erica Farrand1, Augustine Chung2, Jisha Joshua3
1Department of Medicine, University of California San Francisco, San Francisco, CA, USA.
EClinicalMedicine
|March 2, 2026
概括
一个新的机器学习模型,通用间歇性肺病 (ILD) 分类器,使用电子健康记录 (EHR) 准确识别ILD病例. 该工具的性能优于现有的方法,改善了对罕见疾病的研究.
科学领域:
- 医疗信息学 医疗信息学
- 肺部病理学 肺部病理学
- 医疗保健中的机器学习
背景情况:
- 在大型电子健康记录 (EHR) 数据库中,对间歇性肺部疾病 (ILD) 的准确分类具有挑战性.
- 现有的基于规则的方法通常依赖于不可靠的诊断代码来识别ILD.
研究的目的:
- 开发和外部验证一种机器学习算法,以使用常规捕获的EHR数据稳定识别流行的ILD病例.
- 为了比较开发的算法的性能与已建立的基于规则的分类方法.
主要方法:
- 一项回顾性研究使用来自多个学术中心的EHR数据 (UC健康数据仓库).
- 开发了通用ILD分类器,这是一个在标准化EHR数据元素上训练的机器学习模型.
- 在三个独立站点进行外部验证,使用EHR无关的常用数据模型.
- 使用正预测值 (PPV),灵敏度,F1得分和ROC-AUC.评估算法的性能.
主要成果:
- 全球ILD分类表显示出强大的通用性,平均PPV为0.67和ROC-AUC为0.96.
- 该分类器实现了高灵敏度 (0.97) 和F1得分 (0.79).
- 它在关键绩效指标上始终超过了两种基于规则的方法.
结论:
- 全球ILD分类器通过利用易于获得的EHR数据,为大规模的ILD研究提供了一种可靠的方法.
- 这种算法超越了传统的基于规则的方法,为改善ILD的流行病学研究和临床试验提供了基础.
- 潜在的局限性包括后续电子健康记录分析固有的残留混和通用性问题.
更多相关视频
07:15Machine Learning Algorithms for Early Detection of Bone Metastases in an Experimental Rat Model
Published on: August 16, 2020
7.6K
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
8.9K
