VT-MFLV:视觉文本多式模式特征学习V网络用于医疗图像分割
Wenju Wang1, Jiaqi Li1, Zinuo Ye1
1College of Publishing, University of Shanghai for Science and Technology, Shanghai 200093, China.
Journal of imaging
|December 24, 2025
概括
一个新的视觉文本多式特征学习V网络 (VT-MFLV) 通过整合文本数据来改善医疗图像的细分. 这种方法提高了病变识别的准确性,在肺部感染数据集上取得了世界领先的结果.
科学领域:
- 医学图像分析 医学图像分析
- 人工智能的人工智能
- 计算机视觉 计算机视觉
背景情况:
- 现有的多模式细分方法在整合医疗文本以进行视觉特征学习方面存在困难.
- 挑战包括不充分的多式联接和细粒度病变细分的低准确性.
研究的目的:
- 提出视觉文本多式特征学习V网络 (VT-MFLV) 以提高医疗图像细分.
- 通过利用医学图像和文本之间的互补性来提高关键病变识别的准确性.
主要方法:
- 该VT-MFLV模型包含三个模块:诊断图像-文本残余多头语义编码 (DIT-RMHSE),细粒度多模式融合局部注意编码 (FG-MFLA) 和自适应全球特征压缩和聚焦 (AGCF).
- 这些模块促进了语义暗示的保存,减少了预处理的复杂性,加强了本地跨模态交互,并强调了临床相关的损伤区域.
主要成果:
- 对肺部感染数据集 (MosMedData和QaTa-COV1) 的实验证明了VT-MFLV的有效性.
- 在各自的数据集上获得了75.61%和83.34%的子分数和63.98%和72.09%的mIoU分数.
- 业绩达到世界领先的水平,表明病变细分的显著改善.
结论:
- VT-MFLV模型成功地提高了医学成像中的多式融合和病变细分精度.
- 拟议的架构为利用文本数据改善医疗AI应用中的视觉特征学习提供了一个有希望的方向.


