用小型和不平衡的医学成像数据集对监督和自我监督的学习进行比较分析
Andrea Espis1, Chiara Marzi2, Stefano Diciotti3,4
1Department of Electrical, Electronic, and Information Engineering "Guglielmo Marconi" - DEI, University of Bologna, Via dell'Università 50, 47521, Cesena, Italy.
Scientific reports
|September 2, 2025
概括
监督学习通常在小,不平衡的医学成像数据集上胜过自我监督学习. 仔细选择学习方法至关重要,考虑到数据大小和标签可用性,以实现最佳性能.
科学领域:
- 计算机视觉
- 医学成像分析
- 机器学习
背景情况:
- 自主监督学习 (SSL) 有望减少计算机视觉中的标记数据需求.
- 现实世界中的医疗应用通常涉及有限的数据集大小和不平衡的类分布,与大而平衡的数据集不同 (例如,ImageNet).
研究的目的:
- 对比SSL和监督学习 (SL) 在小,不平衡的医学成像数据集上的性能.
- 评估不同标签可用性和类频率分布对模型性能的影响.
主要方法:
- 在四个二元分类任务中进行了实验:年龄预测和阿尔茨海默病诊断 (脑MRI),肺炎检测 (胸部X射线) 和视网膜疾病分类 (OCT).
- 训练组的大小各不相同,平均为843张 (预测年龄),771张 (阿尔茨海默病),1214张 (肺炎) 和33484张 (视网膜疾病) 的图像.
- 用不同的随机种子重复模型训练,以确保结果可靠性和评估不确定性.
主要成果:
- 与评估的SSL方法相比,监督学习 (SL) 在大多数小训练组的实验中表现出更好的表现.
- 即使只有有限的标签数据可访问,SL的优势仍然存在.
- 这些发现在各种医学成像方法和分类任务中是一致的.
结论:
- 这项研究强调,监督学习往往比自我监督学习更有效,用于小型,不平衡的医学成像数据集.
- 机器学习模式的最佳选择至关重要,并且在很大程度上取决于特定的应用约束,包括训练集大小,数据平衡和标签可用性.


