VSmTrans:一个融合自我注意力和卷积的混合范式,用于3D医疗图像细分的3D医疗图像细分
Tiange Liu1, Qingze Bai2, Drew A Torigian3
1School of Intelligence Science and Technology, University of Science and Technology Beijing, Beijing, PR China, 100083; School of Information Science and Engineering, Yanshan University, Qinhuangdao, Hebei PR China, 066004.
Medical image analysis
|September 1, 2024
概括
视觉转换器因计算成本和局部细节捕获有限而难以对3D医疗图像进行细分. 我们的可变形状混合变压器 (VSmTrans) 方法有效地整合了自我注意力和卷积,以获得更高的细分精度.
科学领域:
- 医疗成像医学成像
- 计算机视觉 计算机视觉
- 人工智能的人工智能
背景情况:
- 视觉转换器 (ViTs) 在全球表示学习方面表现出色,但在3D医疗图像细分方面面临挑战.
- 挑战包括大型3D图像的高计算成本和详细特征细分的局部诱导偏差不足.
研究的目的:
- 解决视觉转换器在3D医疗图像细分方面的局限性.
- 提出一种混合模型,平衡全球上下文学习与局部细节提取.
主要方法:
- 引入了可变形状混合变压器 (VSmTrans),这是一个融合自我注意力和卷积的混合范式.
- 开发了一个可变形状的自我注意力机制,以有效地扩大受体场.
- 集成的并行卷积强烈的局部诱导偏差和可学习的参数来平衡范式.
主要成果:
- 在AMOSCT和BraTS2021MRI数据集上,VSmTrans获得了88.3%和89.7%的优异平均子得分.
- 超越了现有的基于Swin变压器和CNN的架构.
- 废除研究证实了混合机制在平衡受感场和局部偏差方面的效率和有效性.
结论:
- 拟议的基于变压器的混合骨干有效地整合了自我注意力和卷积,用于3D医疗图像细分.
- VSmTrans显示出优于现有方法的优势,特别是在捕捉细节方面.
- 混合方法非常适合医疗图像细分,提供全球和本地特征学习之间的平衡.


