合并上下文集群与视觉状态空间模型用于医疗图像分割
IEEE transactions on medical imaging
|March 3, 2025
概括
语境聚类视觉巴 (CCViM) 通过整合本地和全球特征来增强医疗图像细分. 这种新的方法改善了空间上下文的表示,在各种数据集中表现优于现有的方法.
科学领域:
- 计算机视觉 计算机视觉
- 医学图像分析 医学图像分析
- 人工智能的人工智能
背景情况:
- 医疗图像细分需要整合全球和本地特征,这是当前方法的挑战.
- 视觉巴 (ViM) 模型对长距离特征交互有希望,但与短距离依赖性作斗争.
- 现有的ViM方法平整空间令牌,使用固定的模式,限制了动态空间上下文的捕获.
研究的目的:
- 引入一种新的方法,即语境聚类视觉mamba (CCViM),以改善医疗图像细分.
- 解决现有的ViM模型在捕捉长距离和短距离特征相互作用方面的局限性.
- 为了增强空间上下文表示,以便更准确的医疗图像细分.
主要方法:
- 通过将上下文集群模块集成到现有的ViM模型中,开发了CCViM.
- 将分割的图像令牌分成不同的窗口,以便进行可适应的本地集群.
- 结合远距离和短距离特征交互,以改善空间环境.
主要成果:
- 与各种公共数据集 (Kumar,CPM17,ISIC17,ISIC18,Synapse) 上的最先进的方法相比,CCViM表现出优越的性能.
- 该方法有效地捕捉了医疗图像中的远程和短程依赖.
- 增强的空间上下文表示导致了细分精度的提高.
结论:
- 通过改进特征表示,CCViM为医疗图像细分提供了一个简单而有效的解决方案.
- 语境聚类模块成功地解决了以前ViM方法的局限性.
- CCViM代表了医疗图像细分领域的重大进步.


