Hi-End-MAE: Hierarchical encoder-driven masked autoencoders are stronger vision learners for medical image

Fenghe Tang1, Qingsong Yao2, Wenxin Ma1

  • 1School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China (USTC), Hefei, Anhui, 230026, PR China; Center for Medical Imaging, Robotics, and Analytic Computing & LEarning (MIRACLE), Suzhou Institute for Advanced Research, USTC, Suzhou 215123, China; Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology, Suzhou Jiangsu, 215123, China.

Medical Image Analysis
|September 23, 2025
PubMed
Summary

This study introduces Hierarchical Encoder-driven MAE (Hi-End-MAE), a novel Vision Transformer (ViT) pre-training method. Hi-End-MAE enhances medical image segmentation by better utilizing multi-layer representations for improved accuracy.

Related Concept Videos