用于开发人工智能技术的乳房扫描数据集的多样性,包容性和可追溯性:系统审查
Elinor Laws1, Joanne Palmer1, Joseph Alderman1
1University Hospitals Birmingham NHS Foundation Trust, Birmingham, UK; Institute of Inflammation and Ageing, University of Birmingham, Birmingham, UK; National Institute for Health and Care Research Birmingham Biomedical Research Centre, University of Birmingham, Birmingham, UK.
Clinical imaging
|December 1, 2024
概括
这次审查发现,用于人工智能开发的大多数乳腺造影数据集缺乏透明度和多样化的人口代表性,阻碍了乳腺癌查技术的全球研究工作.
科学领域:
- 医疗成像医学成像
- 人工智能的人工智能
- 放射学 放射学是一门学科.
背景情况:
- 对于乳腺癌研究而言,有许多放射性数据集存在,其中一些支持用于查和分类的AI开发.
- 人工智能技术越来越依赖于乳房扫描数据集 (数字化屏幕膜,2D数字和数字乳房图解合成).
研究的目的:
- 识别用于人工智能开发的乳房扫描数据集.
- 描述这些数据集的文件透明度,内容,人口统计和可访问性.
- 评估这些数据集中的多样性和包容性.
主要方法:
- 搜索MEDLINE和谷歌数据集,查找用于AI开发的乳腺成像数据集的研究,直到2024年6月.
- 总结了数据集特征,重点是文档,人口多样性和包容性.
- 审查了数据集的可访问性和个人属性的报告,如种族,种族,性别和性别.
主要成果:
- 在254个参考数据集中,只有28个是可访问的,190个是私有的,36个具有访问障碍.
- 大多数数据集来自欧洲,东亚和北美.
- 个人属性的报告很差,12%的人报告了种族/种族,30%的人报告了性别类别,关于性别与性别的模两可.
结论:
- 乳房造影数据集格局存在重大差距,其特点是全球代表性较差.
- 改进数据集特征和局限性的文档,特别是人口代表性的改进至关重要.
- 解决这些局限性将增强数据集对研究人员的实用性,并为乳房成像中公平的人工智能技术的发展提供信息.


