在ICU中基于AI的评分系统的外部验证:系统性审查和元分析
Patrick Rockenschaub1,2,3, Ela Marie Akay1, Benjamin Gregory Carlisle4
1CLAIM - Charité Lab for AI in Medicine, Charité - Universitätsmedizin Berlin, Berlin, Germany.
对重症监护室 (ICU) 患者的机器学习 (ML) 风险评分的外部验证并不常见,在新数据集中,性能通常会下降. 这凸显了人们对临床实践中当前ML模型可靠性的担忧.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 临床预测模型临床预测模型
背景情况:
- 机器学习 (ML) 模型越来越多地用于预测重症监护室 (ICU) 中的临床恶化.
- 然而,由于过度装配,这些模型在新的医院环境中往往表现不佳.
- 在临床实施之前,外部验证对于评估基于ML的风险评分可靠性至关重要.
研究的目的:
- 系统地审查基于ML的风险评分在ICU患者恶化预测中的外部验证的频率.
- 评估外部验证对这些ML模型性能的影响.
主要方法:
- 在MEDLINE,Web of Science和arXiv进行了系统的文献搜索,寻找使用ML预测ICU患者病情恶化的研究.
- 包括的研究是在2023年12月之前以英语出版的.
- 总结了外部验证的频率,并使用线性混合效应模型分析了性能变化 (接收器操作特征曲线下的区域 - AUROC).
主要成果:
- 在包含的572项研究中,只有14.7%接受了外部验证,到2023年将增加到23.9%.
- 在使用开源数据的研究中,外部验证更常见,特别是MIMIC和eICU数据集.
- 平均而言,AUROC在外部数据中下降了-0.037,近一半的研究显示性能下降大于0.05.
结论:
- 在ICU中对ML风险得分的外部验证很少发生,尽管它的趋势越来越强.
- 在外部数据集中观察到的性能下降引起了人们对许多拟议的ML分数的概括性和可靠性的担忧.
- 过度依赖有限的数据集和独家使用AUROC阻碍了可靠的解释和验证.
更多相关视频
04:54Author Spotlight: IntelliSleepScorer — A High-Accuracy, Accessible GUI Software for Automated Sleep Stage Scoring in Mice and its Application in Psychiatric Research
Published on: November 8, 2024
10:38Observational Study Protocol for Repeated Clinical Examination and Critical Care Ultrasonography Within the Simple Intensive Care Studies
Published on: January 16, 2019
相关概念视频
Data Validation
Nursing assessment guides are generally based on holistic models rather than medical...
Imaging Studies for Cardiovascular System VI: Calcium -Scoring CT
Pre-Procedural Guidelines for Assessing Blood Pressure
