视觉Mamba和xLSTM-UNet用于医疗图像分割
Xin Zhong1, Gehao Lu2, Hao Li1
1School of Information Science and Engineering, Yunnan University, Yunnan, 650504, China.
Scientific reports
|March 10, 2025
概括
新的深度学习模型VMAXL-UNet通过整合结构化状态空间模型 (SSM) 和轻量级LSTM (xLSTM) 来增强医疗图像细分. 它有效地捕捉了当地细节和全球背景,优于现有的方法来准确检测损伤边界.
科学领域:
- 医疗成像医学成像
- 人工智能的人工智能
- 计算机视觉 计算机视觉
背景情况:
- 像CNN和Transformers这样的深度学习模型用于医疗图像细分.
- 由于受体场的有限性,CNN在与远程依赖性作斗争.
- 变压器捕获全球信息,但对于临床使用而言,计算密集.
研究的目的:
- 介绍VMAXL-UNet,这是一个结合SSM和xLSTM的新型网络,用于高效的医疗图像分割.
- 解决现有的CNN和变压器在捕捉本地和全球特征方面的局限性.
- 在复杂的医学成像中提高细分精度和稳定性.
主要方法:
- 开发了VMAXL-UNet,将视觉状态空间 (VSS) 和ViL模块集成到编码器中.
- VSS模块使用SSM捕获远程依赖关系并从遥远地区提取特征.
- ViL模块采用了一个门机制,以加强本地和全球特征的整合.
主要成果:
- 与传统的CNN和基于变压器的模型相比,VMAXL-UNet表现出卓越的性能.
- 该模型在捕获多个数据集 (ISIC17,ISIC18,CVC-ClinicDB,Kvasir) 中的病变边界及其远距离相关性方面表现出色.
- 观察到细分精度和稳定性的显著改善.
结论:
- VMAXL-UNet为高效准确的医疗图像细分提供了一个有前途的方法.
- 集成SSM和xLSTM有效地平衡了当地细节和全球背景.
- 该模型显示了在临床环境中实际应用的潜力.


