MiM:面具中的面具自主监督3D医学图像分析预培训
IEEE transactions on medical imaging
|April 25, 2025
概括
面具中的面具 (MiM) 是一种新的框架,可以提高视觉转换器 (ViT) 在3D医学成像中的性能. 这种自我监督的学习方法通过学习等级表示来改善器官/瘤细分和疾病分类.
科学领域:
- 医疗成像医学成像
- 计算机视觉 计算机视觉
- 人工智能的人工智能
背景情况:
- 视觉变压器 (ViT) 在通过自主监督学习 (SSL) 进行3D医疗图像分析方面表现有前途.
- 蒙面自动编码器 (MAE) 预训练提高了ViT的性能,但由于大数据尺寸,其非等级设计限制了3D医疗图像分析.
研究的目的:
- 介绍一个新的面具在面具 (MiM) 预培训框架为3D医学图像.
- 通过在多个尺度上整合层次化的视觉令牌学习来增强蒙蔽自动编码器 (MAE),以改进表示.
主要方法:
- 提出了面具中的面具 (MiM) 框架,用于面具3D医学图像重建的多级粒度.
- 实施了一种交叉水平对齐机制,以强制执行层次的解剖相似性.
- 在预训练期间利用混合骨干来有效地学习层次表征.
主要成果:
- 在大型计算机断层扫描 (CT) 数据集上预先培训的MiM.
- 在12个用于器官/瘤细分和疾病分类的公共数据集上,MIM在现有SSL方法上表现出优越的性能.
- 通过大规模的预训练 (超过10k卷) 展示了表现的增长.
结论:
- MiM有效地从3D医疗图像中学习歧视性等级表示.
- 拟议的框架显著推进了MAE对3D医疗视觉任务.
- 大规模的预训练进一步提高了MiM在下游医学成像应用中的有效性.


