调查DermaMNIST和Fitzpatrick17k皮肤学图像数据集的质量
Kumar Abhishek1, Aditi Jain2, Ghassan Hamarneh3
1School of Computing Science, Simon Fraser University, Burnaby, V5A 1S6, Canada. kabhishe@sfu.ca.
Scientific data
|February 1, 2025
概括
数据质量对于皮肤病学深度学习至关重要. 这项研究确定并纠正了受欢迎的皮肤图像数据集中的数据问题,提高了模型可靠性和诊断准确性.
科学领域:
- 皮肤病学 皮肤病学
- 人工智能的人工智能
- 医疗成像医学成像
背景情况:
- 深度学习模型在皮肤病学任务中实现了高精度.
- 大数据集对于训练可靠的深度神经网络至关重要.
- 数据质量问题可以显著影响模型性能和可靠性.
研究的目的:
- 为了仔细分析流行皮肤学图像数据集 (DermaMNIST,HAM10000,Fitzpatrick17k) 的数据质量问题.
- 量化数据质量问题对基准测试结果的影响.
- 建议对这些数据集进行更正,并确保可重复性.
主要方法:
- 进行DermaMNIST,HAM10000和Fitzpatrick17k数据集的详细分析.
- 识别常见的数据质量问题:重复,数据泄露,错误标记的图像和未定义的测试分区.
- 测量这些问题对模型性能指标的影响.
主要成果:
- 在分析的皮肤病学数据集中发现了重要的数据质量问题.
- 展示了这些问题如何对深度学习模型的基准结果产生负面影响.
- 提供了数据集的更正版本和公开可用的分析管道.
结论:
- 数据质量是皮肤病学深度学习成功的关键因素.
- 解决数据质量问题对于可靠的诊断工具至关重要.
- 公开分享分析方法促进了透明度,并促进了医疗AI数据集的改进.


