VT-MFLV: Vision-Text Multimodal Feature Learning V Network for Medical Image Segmentation.

Wenju Wang1, Jiaqi Li1, Zinuo Ye1

  • 1College of Publishing, University of Shanghai for Science and Technology, Shanghai 200093, China.

Journal of Imaging
|December 24, 2025
PubMed
Summary

A new Vision-Text Multimodal Feature Learning V Network (VT-MFLV) improves medical image segmentation by integrating text data. This approach enhances lesion recognition accuracy, achieving world-leading results on pulmonary infection datasets.