Zig-RiR:Zigzag RWKV-in-RWKV用于高效的医疗图像分割
IEEE transactions on medical imaging
|April 17, 2025
概括
本研究介绍了Zigzag RWKV-in-RWKV (Zig-RiR),这是一种用于医学图像细分的新型深度学习模型. Zig-RiR有效地捕捉全球和本地特征,显著提高准确性和速度,同时降低计算成本.
科学领域:
- 人工智能的人工智能
- 医疗成像医学成像
- 计算机视觉 计算机视觉
背景情况:
- 深度学习模型,特别是那些结合卷积神经网络 (CNN) 和变压器的模型,通过提取本地和全球特征,在医学图像细分方面表现出色.
- 然而,变压器的二次计算复杂性限制了它们在处理高分辨率医疗图像方面的效率.
- 接收权重关键值 (RWKV) 模型为长距离建模提供线性复杂性,为更高效的医疗图像分析提供了机会.
研究的目的:
- 为了解决医疗图像细分现有模型的局限性,本研究探讨了RWKV在提高效率和精度方面的潜力.
- 提出一种新的嵌套架构,Zigzag RWKV-in-RWKV (Zig-RiR),旨在有效地捕捉本地和全球特征,而不牺牲空间连续性.
- 为了增强当地特征的探索,并在细分过程中保持空间连贯性.
主要方法:
- 提出了一种新的嵌套结构,Zigzag RWKV-in-RWKV (Zig-RiR),包括外部和内部RWKV块,用于分层的特征提取.
- 外部Zig-RWKV将本地补丁处理为"视觉句子",以捕捉全球背景.
- 内部Zig-RWKV进一步将子补丁作为"视觉词"来分析,以提取详细的本地信息,并通过Zigzag-WKV注意力机制来补充,以保持空间连续性.
主要成果:
- Zig-RiR模型在四个不同的数据集 (2D和3D模式) 中展示了医疗图像细分的卓越准确性和效率.
- 在高分辨率1024×1024图像上测试时,Zig-RiR实现了14.4倍的速度改进和89.5%的GPU内存使用量减少,相比于最先进的方法.
- 提出的方法有效地整合了全球和本地特征提取,同时保持了空间连续性,优于现有的方法.
结论:
- 齐加格RWKV-in-RWKV (Zig-RiR) 架构为医疗图像细分提供了高效和准确的解决方案.
- 这种新的方法克服了传统变压器模型的计算局限性,使高分辨率医疗图像的有效分析成为可能.
- Zig-RiR代表了医疗图像细分的重大进步,为临床应用提供了更快,更有效的记忆替代方案.


