Efficiently Training Vision Transformers on Structural MRI Scans for Alzheimer's Disease Detection
Arxiv
|March 30, 2023
Summary
Vision transformers (ViT) show promise for neuroimaging tasks like Alzheimer's disease (AD) classification. Fine-tuning ViT models pre-trained on MRI scans significantly boosts classification performance, essential for limited data scenarios.
Area of Science:
- Neuroimaging
- Artificial Intelligence
- Medical Diagnostics
Background:
- Large-scale neuroimaging aids in understanding brain disease factors, diagnosis, and prognosis.
- Convolutional Neural Networks (CNNs) are established for neuroimaging analysis.
- Vision Transformers (ViT) offer a novel deep learning alternative for computer vision tasks.
Approach:
- Evaluated ViT architecture variants for sex and Alzheimer's disease (AD) classification using 3D brain MRI.
- Investigated the impact of pre-training strategies, including synthetic and real MRI data.
- Analyzed the influence of data augmentation, learning rate schedules, and data-model scaling on ViT performance.
Key Points:
- ViT models achieved high AUC scores: 0.987 for sex and 0.892 for AD classification.
- Pre-training ViT models on synthetic or real MRI data enhanced performance by 5% and 9-10%, respectively.
- Optimized ViT training strategies are crucial for neuroimaging applications with limited datasets.
Conclusions:
- ViT architectures are effective for neuroimaging classification tasks, including AD detection.
- Pre-training and strategic training techniques are vital for maximizing ViT performance in neuroimaging.
- This study provides insights into optimizing ViT models for brain MRI analysis.


