高端MAE:由等级编码器驱动的蒙面自动编码器是医疗图像细分的更强的视觉学习器
Fenghe Tang1, Qingsong Yao2, Wenxin Ma1
1School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China (USTC), Hefei, Anhui, 230026, PR China; Center for Medical Imaging, Robotics, and Analytic Computing & LEarning (MIRACLE), Suzhou Institute for Advanced Research, USTC, Suzhou 215123, China; Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology, Suzhou Jiangsu, 215123, China.
Medical image analysis
|September 23, 2025
概括
这项研究介绍了层次编码器驱动的MAE (Hi-End-MAE),这是一个新的视觉转换器 (ViT) 预训练方法. 高端MAE通过更好地利用多层表示来提高医疗图像细分,以提高准确性.
科学领域:
- 医疗成像医学成像
- 计算机视觉 计算机视觉
- 人工智能的人工智能
背景情况:
- 由于有限的标记数据,医疗图像细分面临挑战.
- 视觉转换器 (ViT) 预训练与掩盖图像建模 (MIM) 提供了计算效率和概括性.
- 现有的基于ViT的MIM方法往往忽略了丰富的多层表示,这对于细粒度的医学图像分析至关重要.
研究的目的:
- 为了解决目前基于ViT的医学成像MIM预培训框架的局限性.
- 引入一种新的预训练解决方案,分层编码器驱动的MAE (Hi-End-MAE),用于改进医疗图像细分.
- 加强ViT内部多层表示的利用,用于精确的医疗下游任务.
主要方法:
- 开发了一种基于ViT的预训练方法 - - 基于层次编码器驱动的MAE (Hi-End-MAE).
- 整合了两个关键的创新:编码器驱动的重建和层次密集解码.
- 预先训练有素的高端MAE在一万张CT扫描的大数据集上.
主要成果:
- 高端MAE在9个医学图像细分基准中展示了卓越的转移学习能力.
- 该方法有效地通过利用等级表示来捕获细粒度的语义信息.
- 在各种下游医学成像任务中取得了最先进的或具有竞争力的表现.
结论:
- 高端MAE提供了一种简单而有效的解决方案,用于基于ViT的医学成像预培训.
- 拟议的方法强调了ViT在推进医疗图像分析和细分方面的潜力.
- 编码器驱动的重建和层次解码对于学习医学图像细分中的信息特征至关重要.

