评估人工智能在乳房造 mammography 制造商的普及情况
Alistair J Hickman1,2,3, Sandra Gomes2, Lucy M Warren2
1Department of Physics, University of Surrey, Guildford, United Kingdom.
PLOS digital health
|August 12, 2025
概括
用于乳腺密度分类的人工智能 (AI) 工具在训练来自多个制造商的多种乳房扫描图像时表现最好. 在单一制造商数据上训练人工智能导致在其他品牌上测试时显著下降性能,影响临床使用.
科学领域:
- 医疗成像医学成像
- 人工智能的人工智能
- 放射学 放射学是一门学科.
背景情况:
- 乳房摄影对于乳腺癌查至关重要.
- 人工智能 (AI) 工具越来越多地用于自动分析乳房影像.
- 不同制造商的乳房扫描图像采集的变化可能会影响AI性能.
研究的目的:
- 调查乳腺图像制造商对人工智能工具对乳腺密度分类的性能的影响.
- 确定人工智能模型的最佳培训策略,以确保在不同乳房学系统中实现泛化.
主要方法:
- 在Hologic和通用电气制造商的回顾性数据集上训练和验证了三种深度学习算法,包括混合数据集.
- 在来自Hologic,通用电气,混合和西门子制造商的独立数据集上测试了算法.
- 使用接收器操作特征曲线 (AUC) 下的面积和贝叶斯签名排名测试,比较算法性能.
主要成果:
- 人工智能模型在同一个制造商的图像上训练和测试时获得了高性能 (例如,Hologic火车/测试AUC:0.98).
- 当在一个制造商的数据上训练的模型在另一个制造商的数据上进行测试时,观察到显著的性能下降 (例如,通用电气火车/Hologic测试AUC:0.56).
- 在混合数据集上训练的AI模型,包括来自多个制造商的图像,显示出最佳的整体性能和通用性.
结论:
- 乳腺图像制造商对人工智能工具对乳腺密度分类的性能产生重大影响.
- 在代表多个制造商的不同数据集上训练的AI模型更好地对未见的数据进行概括.
- 人工智能工具的临床部署需要培训数据,这些数据反映了查程序中使用的乳房扫描设备的异质性,以确保可靠的性能.


