人工智能模型用于肺结节分类的诊断性能:一个多模型评估
Sarah K Herber1, Lukas Müller2, Daniel Pinto Dos Santos1
1Department of Diagnostic and Interventional Radiology, University Medical Center of the Johannes Gutenberg-University Mainz, Mainz, Germany.
European radiology
|July 27, 2025
概括
商业人工智能 (AI) 模型在分类肺结节时的准确性较低,错误阴性率高,许多中间风险结果. 这些人工智能工具尚未可靠用于肺癌诊断的独立临床使用.
科学领域:
- 肺部医学 肺部医学
- 放射学 放射学是一门学科.
- 医疗保健中的人工智能
背景情况:
- 肺癌是癌症死亡的主要原因,早期检测肺结节对于改善生存率至关重要.
- 使用成像来区分恶性和良性肺结节仍然是一个诊断挑战.
- 人工智能 (AI) 正在探索,以提高肺结节分类的准确性.
研究的目的:
- 评估商业上可用的AI软件模型在分类肺结节的诊断性能.
- 将AI模型的准确性与基因病理学进行比较作为黄金标准.
- 确定AI在肺结节诊断的临床应用中的潜在局限性.
主要方法:
- 从CT扫描中对158个肺结节 (4-30毫米) 进行了回顾性分析.
- 三种人工智能软件模型被用于分类结节,计算了灵敏度,特异性和错误率.
- 使用接收器操作特征曲线 (AUC) 下的面积来评估诊断准确性,并根据结节特征和CT扫描参数进行子组分析.
主要成果:
- 一个人工智能模型将大量的结节分类为中级风险,阻碍了评估.
- 其他人工智能模型表现出中度灵敏度 (53.1-70.3%),但特异性低 (46.7-66.7%),导致高假阳性率 (45.5-52.4%).
- 在ROC曲线下的面积 (AUC) 值在0.5到0.6之间,表明诊断能力有限. 高达49%的结节被归类为中等风险,性能因CT扫描类型而异.
结论:
- 目前基于人工智能的软件模型显示肺结节分类的特异性不足和高假阴性率.
- 很大一部分结节被归类为中等风险,限制了临床效用.
- 评估的AI模型还不适合在肺结节诊断中独立的临床应用.


