保持人工智能在轨:定期监测乳房扫描中的算法更新
Adnan G Taib1, Jonathan J James2, George J W Partridge1
1Translational Medical Sciences, School of Medicine, University of Nottingham, Clinical Sciences Building, Nottingham City Hospital, Nottingham NG5 1PB, United Kingdom.
European journal of radiology
|April 19, 2025
概括
升级的人工智能 (AI) 模型的诊断性能与其前身在乳房镜查中的诊断性能相当. 与人类读者相比,两种AI版本的特异性都得到了改善,但较新的AI版本显示了敏感度的统计学上显著改善.
科学领域:
- 医学成像和人工智能 医学成像和人工智能
- 放射学和乳腺癌查 放射学和乳腺癌查
- 卫生信息学和绩效基准测试
背景情况:
- 人工智能 (AI) 越来越多地用于医学诊断,需要强大的绩效评估方法.
- 将AI工具的连续软件版本进行比较对于了解产品改进和临床实用性至关重要.
- 外部质量保证计划,如乳房扫描中的个人表现 (PERFORMS) 提供标准化的数据集用于绩效评估.
研究的目的:
- 建立一种方法来比较两个连续的商业AI软件发布与训练有素的人类阅读器的性能.
- 通过PERFORMS外部质量保证计划评估AI的性能,这是一个可信的乳房扫描查基准.
- 将AI版本1 (V1) 和版本2 (V2) 的诊断准确度,灵敏度和特异性与人类读者进行比较.
主要方法:
- 一个回顾性分析10个PERFORMS测试集 (60个具有挑战性的案例),由1,254个人类读者 (2012-2023) 和AI V1 (2022) 和V2 (2023) 评估.
- 通过人类读者和人工智能模型进行独立的乳房分析,重点关注每种乳房或病变的恶性瘤得分最高的怀疑.
- 计算灵敏度,特异性和接收器操作特征曲线 (AUC) 下的面积,用于比较性能分析.
主要成果:
- 在AI V1 (0.93) 和V2 (0.94) (p=0.13) 之间没有观察到AUC的显著差异.
- 与人类读者 (83.2%,p=0.04) 相比,AI V2表现出显著更高的灵敏度 (88.7%),而AI V1没有显著差异 (87.5%,p=0.12).
- 人工智能V1 (87.4%) 和V2 (88.2%) 均表现出明显高于人类读者的特异性 (79.0%,p<0.01).
结论:
- 升级的AI模型 (V2) 与其基于AUC的前身 (V1) 相比,整体诊断性能没有显著差异.
- 更新的AI版本 (V2) 实现了比人类读者更高的统计学上显著的灵敏度,这表明恶性病例的检测得到了改进.
- 两种AI版本的特异性都明显超过了人类读者,这表明在乳房扫描检查中错误阳性较少.


