将特征选择和表格数据增强与生成对抗网络相结合,以增强皮肤黑色素瘤的识别和解释性
Vanesa Gómez-Martínez1, David Chushig-Muzo2, Marit B Veierød3
1Department of Signal Theory and Communications, Telematics and Computing Systems, Rey Juan Carlos University, Madrid, 28943, Spain. vanesa.gomez@urjc.es.
BioData mining
|October 31, 2024
概括
这项研究通过组合特征选择和合成数据生成 (CTGAN) 增强了对不平衡数据集的黑色素瘤识别. 这种方法提高了皮肤癌检测的诊断准确度.
科学领域:
- 皮肤病学 皮肤病学
- 人工智能的人工智能
- 医疗成像医学成像
背景情况:
- 皮肤黑色素瘤是一种侵袭性皮肤癌,导致大多数皮肤癌死亡.
- 人工智能和皮肤显微镜图像有助于黑色素瘤的识别,但高维数据和阶级不平衡带来了挑战.
研究的目的:
- 通过组合特征选择和数据增强,增强不平衡数据集中的黑色素瘤识别.
- 为解决皮肤镜像数据集中的高维度和不足表示问题.
主要方法:
- 采用集体特征选择 (FS) 和条件表式生成对抗网络 (CTGAN) 进行数据增强.
- 利用PH2和Derm7pt数据集中的手工制作和嵌入功能.
- 评估不平衡比率 (IR) 的影响,并使用SHAP,引导测试和UMAP进行解释性.
主要成果:
- 综合FS,CTGAN和线性模型的组合产生了最好的预测结果 (AUCROC 87%与SVM,76%与LASSO).
- 黑色素瘤病变的特征是颜色特征,而非黑色素瘤病变的特征是纹理特征.
结论:
- 结合FS和合成数据,有效地改善了黑色素瘤识别模型.
- 这项研究推进了皮肤病变分析,有助于黑色素瘤检测和特征解释.


