小規模で不均衡な医療画像データセットによる監督および自己監督学習の比較分析
Andrea Espis1, Chiara Marzi2, Stefano Diciotti3,4
1Department of Electrical, Electronic, and Information Engineering "Guglielmo Marconi" - DEI, University of Bologna, Via dell'Università 50, 47521, Cesena, Italy.
Scientific reports
|September 2, 2025
まとめ
監督学習は,小規模で不均衡な医療画像データセットで,一般的に自己監督学習を上回ります. 学習方法の慎重な選択は,データサイズとラベルの可用性を考慮して,最適なパフォーマンスを確保することが重要です.
科学分野:
- コンピュータ・ビジョン
- 医学画像分析
- 機械学習
背景:
- セルフ・スーパーバイザー・ラーニング (SSL) は,コンピュータ・ビジョンにおけるラベル付きデータの必要性を削減する見込みを示しています.
- 現実世界の医療アプリケーションは,大きなバランスの取れたデータセット (例えば,ImageNet) と異なり,限られたデータセットサイズと不均衡なクラス分布を伴う.
研究 の 目的:
- 小規模で不均衡な医療画像データセットでSSLと監督学習 (SL) のパフォーマンスを比較する.
- レーベルの可用性やクラスの周波数分布がモデルの性能に与える影響を評価する.
主な方法:
- 実験は4つのバイナリー分類タスク:年齢予測とアルツハイマー病の診断 (脳MRI),肺炎検出 (胸部X線),網膜疾患分類 (OCT) について行われました.
- 訓練セットのサイズは,平均843 (年齢予測),771 (アルツハイマー病),1,214 (肺炎),33,484 (網膜疾患) の画像で様々でした.
- 結果の信頼性と不確実性の評価をするために,異なるランダムな種子でモデルトレーニングを繰り返した.
主要な成果:
- 監督学習 (SL) は,小規模なトレーニングセットでのほとんどの実験で,評価されたSSL方法と比較して優れたパフォーマンスを示しました.
- SLのこの利点は,限られた量のラベルデータしかアクセスできない場合でも維持された.
- この結果は,さまざまな医療画像処理方法と分類作業において一貫していました.
結論:
- この研究は,小規模で不均衡な医療画像データセットでは, 監督学習が自主監督学習よりも効果的であることを強調しています.
- 機械学習パラダイムの最適な選択は,トレーニングセットのサイズ,データバランス,ラベルの可用性など,特定のアプリケーションの制約に大きく依存します.


