文本辅助视觉模型用于医疗图像分割
IEEE journal of biomedical and health informatics
|May 14, 2025
概括
本研究介绍了一种文本辅助视觉 (TAV) 模型,用于增强医疗图像细分. 新的三导注意模块 (TGAM) 通过有效地整合图像和文本数据来提高细分精度.
科学领域:
- 医疗成像医学成像
- 人工智能的人工智能
- 计算机视觉 计算机视觉
背景情况:
- 准确的医学图像细分对于自动诊断和治疗计划至关重要.
- 深度学习模型主要依赖于图像数据,经常忽视文本报告中的有价值信息.
- 现有的注意力机制在与跨模式对齐方面扎,限制了在多模式场景中的表现.
研究的目的:
- 开发一种新的文本辅助视觉 (TAV) 模型,以改善医疗图像细分.
- 引入一个三导注意力模块 (TGAM) 进行有效的跨模式特征学习.
- 通过利用视觉和文本数据来提高细分精度.
主要方法:
- 提出了一个文本辅助视觉 (TAV) 模型,其中包含了一个新的三导注意模块 (TGAM).
- TGAM计算视觉-视觉,语言-语言和语言-视觉注意力,以求特征相关性.
- 使用注意力门 (AG) 来调节TGAM的影响,防止信息溢出.
主要成果:
- 在两个医疗图像细分数据集上,TAV模型实现了最先进的性能.
- 与现有车型相比,TAV的性能提高了2-7%.
- 广泛的实验验证了TAV模型中的单个组件的有效性.
结论:
- TAV模型代表了多模式医疗图像细分的重大进步.
- 通过TGAM集成文本报告大大提高了细分精度.
- 拟议的方法为利用医疗AI中的多模式数据提供了一个有希望的方向.


