Efficiently Training Vision Transformers on Structural MRI Scans for Alzheimer's Disease Detection
Summary
Vision transformers (ViT) show promise for neuroimaging tasks like Alzheimer's disease classification. Fine-tuning ViT models pre-trained on MRI data significantly boosts diagnostic performance, aiding in early detection and prognosis.
Area of Science:
- Neuroimaging
- Artificial Intelligence
- Medical Diagnostics
Background:
- Large-scale neuroimaging is crucial for understanding brain diseases and improving diagnosis.
- Convolutional Neural Networks (CNNs) are established for analyzing brain images.
- Vision Transformers (ViTs) are emerging deep learning models for computer vision tasks.
Purpose of the Study:
- To evaluate Vision Transformer (ViT) architecture variants for neuroimaging tasks.
- To assess ViT performance in classifying sex and Alzheimer's disease (AD) from 3D brain MRI.
- To investigate the impact of pre-training and training strategies on ViT performance in neuroimaging.
Main Methods:
- Tested two ViT architecture variants on 3D brain MRI data.
- Classified sex and Alzheimer's disease (AD) using the ViT models.
- Evaluated models on benchmark AD datasets, employing pre-training on synthetic and real MRI scans.
- Analyzed the effects of data augmentation, learning rate schedules, and data-model scaling.
Main Results:
- Achieved high AUC scores: 0.987 for sex classification and 0.892 for AD classification.
- Demonstrated performance boosts of 5% (synthetic pre-training) and 9-10% (real MRI pre-training).
- Identified optimal ViT training strategies crucial for limited neuroimaging datasets.
Conclusions:
- ViT models are effective for neuroimaging classification tasks, including Alzheimer's disease detection.
- Pre-training and specific training strategies enhance ViT performance in neuroimaging.
- These models hold potential for clinical applications in AD diagnosis, subtyping, and prognosis.


