评估深度学习模型的稳定性,这些模型经过训练来诊断异常性肺纤维化,使用了回顾性研究
Wenxi Yu1, Michael F McNitt-Gray1, Jonathan G Goldin1
1Department of Biostatistics, University of California, Los Angeles, California, USA.
Medical physics
|March 20, 2025
概括
用于诊断异常性肺纤维化 (IPF) 的深度学习模型显示,当应用到来自不同成像协议的CT扫描时,其特异性降低. 协议变化,特别是有效的mAs和切片厚度,影响临床实践中的模型稳定性.
科学领域:
- 放射学 放射学是一门学科.
- 人工智能的人工智能
- 医疗成像医学成像
背景情况:
- 深度学习 (DL) 系统在临床采用方面面临挑战,原因是各种成像协议的稳定性尚未得到证实.
- 在不同的条件下评估DL模型的性能对于可靠的临床实施至关重要.
研究的目的:
- 评估先前开发的DL模型的性能和稳定性,以区分异常性肺纤维化 (IPF) 与其他间歇性肺病 (ILD).
- 用标准化参考和各种非参考成像协议获得的胸部CT扫描来评估这些模型.
主要方法:
- 测试了三种DL模型 (1 2D,2 3D),这些模型先前被训练来将ILD患者分类为IPF或非IPF.
- 评估使用了343名非IPFILD受试者的CT扫描,在参考条件和非参考条件下获得.
- 一种通用线性混合效应模型 (GLMM) 确定了影响诊断一致性的CT技术参数.
主要成果:
- 在非参考协议上评估时,所有三种DL模型的整体特异性都下降了 (两种模型的p < 0.05).
- 平均有效mAs是降低预测性能的关键因素 (p < 0.001).
- 平均有效mAs和切片厚度的差异显著影响了一个模型的性能 (p = 0.03).
结论:
- 基于DL的IPF诊断模型在应用到来自不同成像协议的CT数据时表现出缺乏稳定性.
- 对获得和重建条件的仔细考虑对于在临床环境中开发和部署DL模型至关重要.


