在人工智能中模拟校准和目标人群之间的不匹配,以进行乳房镜检查,这是一项回顾性VAIB研究
Haiko Schurz1, Klara Solander2, Davida Åström2
1Department of Oncology-Pathology, Karolinska Institutet, Solna, Sweden. haiko.schurz@ki.se.
NPJ digital medicine
|May 9, 2025
概括
人工智能癌症检测模型需要具有代表性的校准数据. 获取年份,年龄,乳腺密度或乳房扫描供应商的不匹配显著扭曲癌症检测率,影响临床AI整合.
科学领域:
- 医疗成像中的人工智能
- 放射学和医疗诊断的医学诊断.
背景情况:
- 癌症检测的人工智能 (AI) 模型需要仔细校准,以优化癌症检测率 (CDR) 和错误阳性率之间的平衡.
- 确保AI工具在临床环境中的可靠性,需要了解校准数据的变化如何影响性能.
研究的目的:
- 模拟和量化六种类型的人口不匹配对AI癌症检测性能的影响.
- 评估CDR因非代表性校准数据集引起的偏差的临床意义.
主要方法:
- 模拟非代表性数据集以校准临床使用的AI模型.
- 在校准和目标人群之间在采购年,年龄,乳腺密度分布和乳房扫描供应商之间引入了不匹配.
- 评估了由此导致的癌症检测率 (CDR) 扭曲.
主要成果:
- 收购年不匹配导致CDR扭曲率从-3%到+19%.
- 年龄不匹配导致CDR扭曲率从-0.2%到+27%.
- 乳腺密度的变化导致CDR变化在+1%至16%之间.
- 哺乳镜供应商的差异导致了显著的CDR扭曲,从-32%到+33%.
结论:
- 校准和目标人群之间的不匹配在AI性能中引入了临床上显著的偏差.
- 确保校准数据集对目标临床群体具有代表性,对于在医疗保健中安全有效地整合人工智能至关重要.


