Video Experimental Relacionado
Updated: Jul 2, 2026

04:48
Application of Deep Learning-Based Medical Image Segmentation via Orbital Computed Tomography
Published on: November 30, 2022
3.3K
VT-MFLV: Red de Aprendizaje de Características Multimodales Visión-Texto para Segmentación de Imágenes Médicas
Wenju Wang1, Jiaqi Li1, Zinuo Ye1
1College of Publishing, University of Shanghai for Science and Technology, Shanghai 200093, China.
Journal of imaging
|December 24, 2025
Resumen
Una nueva Red de Aprendizaje de Características Multimodales Visión-Texto (VT-MFLV) mejora la segmentación de imágenes médicas al integrar datos de texto. Este enfoque mejora la precisión del reconocimiento de lesiones, logrando resultados líderes a nivel mundial en conjuntos de datos de infección pulmonar.
Área de la Ciencia:
- Análisis de Imágenes Médicas
- Inteligencia Artificial
- Visión por Computadora
Sus antecedentes:
- Los métodos de segmentación multimodales existentes tienen dificultades para integrar texto médico para el aprendizaje de características visuales.
- Los desafíos incluyen una fusión multimodal insuficiente y una baja precisión en la segmentación de lesiones finas.
Objetivo del estudio:
- Proponer la Red de Aprendizaje de Características Multimodales Visión-Texto (VT-MFLV) para mejorar la segmentación de imágenes médicas.
- Mejorar la precisión del reconocimiento de lesiones críticas explotando la complementariedad entre imágenes médicas y texto.
Principales métodos:
- El modelo VT-MFLV incorpora tres módulos: Codificación Semántica Residual Multicabeza de Diagnóstico Imagen-Texto (DIT-RMHSE), Codificación de Atención Local de Fusión Multimodal de Grano Fino (FG-MFLA) y Compresión y Enfoque Adaptativo de Características Globales (AGCF).
- Estos módulos facilitan la preservación de señales semánticas, reducen la complejidad del preprocesamiento, fortalecen la interacción intermodal local y enfatizan las regiones de lesiones clínicamente relevantes.
Principales resultados:
- Los experimentos en conjuntos de datos de infección pulmonar (MosMedData y QaTa-COV1) demostraron la efectividad de VT-MFLV.
- Se lograron puntuaciones Dice del 75,61 % y 83,34 %, y puntuaciones mIoU del 63,98 % y 72,09 % en los respectivos conjuntos de datos.
- El rendimiento alcanzó niveles líderes a nivel mundial, lo que indica mejoras significativas en la segmentación de lesiones.
Conclusiones:
- El modelo VT-MFLV mejora con éxito la fusión multimodal y la precisión de la segmentación de lesiones en imágenes médicas.
- La arquitectura propuesta ofrece una dirección prometedora para aprovechar los datos de texto para mejorar el aprendizaje de características visuales en aplicaciones de IA médica.

