虚拟成像试验方法的实用性,用于对AI系统和训练数据的客观表征
Fakrul Islam Tushar1,2, Lavsen Dahal1,2, Saman Sotoudeh-Paima1,2
1Duke University School of Medicine, Center for Virtual Imaging Trials, Carl E. Ravin Advanced Imaging Laboratories, Dept. of Radiology, Durham, North Carolina, United States.
Journal of medical imaging (Bellingham, Wash.)
|February 17, 2026
概括
虚拟成像试验 (VIT) 提高了人工智能 (AI) 模型在医学成像中的可信度. 这项研究表明,VIT提供了对AI性能的客观见解,提高了临床使用的透明度和可靠性.
科学领域:
- 医疗成像医学成像
- 人工智能的人工智能
- 计算病理学计算病理学
背景情况:
- 在医学成像中,人工智能模型的可信度受到模型多样性,数据变异性和可重现性挑战的阻碍.
- 确保人工智能模型在不同数据集和临床环境中可靠运行仍然是一个重大障碍.
研究的目的:
- 探索新兴虚拟成像试验 (VIT) 方法论的实用性,以评估AI模型在医学成像中的可信性.
- 为评估AI模型性能和理解影响有效性的因素提供客观资源.
主要方法:
- 这项研究利用了COVID-19诊断的案例,使用计算机断层扫描 (CT) 和胸部放射 (CXR) 数据.
- 用3D ResNet-like和2D EfficientNetv2架构开发了多个AI模型,并在各种临床和虚拟数据集上进行了测试.
- 用曲线下的面积 (AUC) 和对置信区间的DeLong方法来评估模型性能.
主要成果:
- 在更多样化的数据集上训练的AI模型显示出优异的外部测试性能 (AUC 0.70-0.76).
- 在内部和外部验证之间观察到显著的性能下降,强调需要多样化的数据.
- 维特提供了对模型和数据集实用性的客观评估,揭示了数据特征,患者因素和成像物理对AI有效性的影响.
结论:
- 虚拟成像试验提高了医疗成像中的AI模型的透明度和可靠性.
- 维特提供了对人工智能性能驱动因素的细微见解,弥合了研究和临床应用之间的差距.


