通过共享注意力视觉转换器进行高效的医疗图像分析的一般框架.
IEEE transactions on medical imaging
|December 17, 2025
概括
视觉转换器 (ViT) 面临医疗图像数据效率和参数效率低下的问题. 拟议的共享注意力视觉变压器 (SAViT) 增强了本地特征捕获,并减少了对改善医疗AI的计算需求.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 医疗成像医学成像
背景情况:
- 视觉转换器 (ViT) 在医疗图像分析中显示出潜力,但受到数据和参数低效的影响.
- 在数据稀缺的场景中捕捉本地特征的能力有限,这阻碍了ViT的性能.
- 高计算和存储要求完全微调限制了ViT的适用性.
研究的目的:
- 引入共享注意力视觉变压器 (SAViT) 以实现高效准确的医疗图像分析.
- 解决医疗应用视觉变压器中的数据低效和参数低效挑战.
- 开发一个在从零开始培训和转移学习场景中表现出色的模型.
主要方法:
- 建议采用三个模块的SAVIT模型:共享先前注意 (SPA) 以提高数据效率,MixPool用于全球建模,以及低级多头自我注意 (Lr-MSA) 以提高参数效率.
- SPA使用视觉提示来在当地区域之间分享注意力权重,改善局部性和翻译不变性.
- 混合池通过多聚合汇总了本地特征,以保持远程依赖,而lr-msa使用低级别的注意力权重降低了计算复杂性.
主要成果:
- SAViT在视网膜病变,皮肤镜检查和放射学等医学成像模式中表现出强烈的概括性.
- 当从头开始训练时,与20多个医疗特定和基于ViT的模型相比,实现了高数据效率和卓越的性能.
- 在参数效率转移学习方面表现出色,在6个数据集中表现优于17个模型,可训练参数显著减少.
结论:
- SAViT为医疗图像分析提供了一种高效准确的解决方案,克服了视觉转换器的主要局限性.
- 该模型的创新模块提高了数据效率,局部,全球建模和参数效率.
- 在医疗保健中,SAVIT为开发强大且可计算的AI模型提供了有前途的进展.


