揭示用于医疗人工智能开发的公开可用的COVID-19数据集中的透明度差距 - - 一项系统性审查
Joseph E Alderman1, Maria Charalambides2, Gagandeep Sachdeva3
1Queen Elizabeth Hospital, University Hospitals Birmingham NHS Foundation Trust, Birmingham, UK; Institute of Inflammation and Ageing, University of Birmingham, Birmingham, UK; NIHR Birmingham Biomedical Research Centre, University of Birmingham, Birmingham, UK.
The Lancet. Digital health
|October 25, 2024
概括
在COVID-19大流行期间,由于数据质量差,医疗保健的AI模型面临偏见. 对192个数据集的审查发现了元数据中的重大差距,阻碍了公平的人工智能的发展.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能在医学中的应用
- 数据科学数据科学数据科学
背景情况:
- COVID-19大流行加速了人工智能 (AI) 在医疗资源管理方面的发展.
- 现有的健康数据集经常表现出局限性和偏见,可能导致不公平的AI技术.
- 系统审查对于评估人工智能开发中使用的数据质量至关重要.
研究的目的:
- 在COVID-19大流行期间系统评估用于AI开发的数据集的质量和完整性.
- 确定元数据,构成,数据可访问性以及这些数据集的伦理考虑方面的缺陷.
- 为未来的卫生紧急情况提供AI数据收集和文档的最佳实践信息.
主要方法:
- 进行了系统审查,选了来自MEDLINE的文章,并利用谷歌数据集搜索.
- 分析了在疫情期间确定用于AI开发的192个数据集.
- 分析的重点是元数据的完整性,人口结构,数据可访问性和道德考虑.
主要成果:
- 在数据集文档中发现了重大缺陷:只有48%的人报告了原籍国,43%的人报告了年龄,25%以下的人包括性别,性别,种族或种族.
- 关于数据标签,伦理审查和患者同意的信息经常缺失.
- 报告指出,数据可追溯性不足,历史数据的未经承认的重复使用,例如儿科胸部X射线.
结论:
- 在COVID-19大流行期间用于AI开发的数据集显示出大量的质量和文档差距.
- 这些缺陷增加了开发有偏见的AI模型的风险,特别是影响弱势群体.
- 改善数据质量,透明的文档和道德监督对于医疗保健中可靠的人工智能至关重要,特别是在危机期间.


