Video Experimental Relacionado
Updated: May 7, 2026

04:48
Application of Deep Learning-Based Medical Image Segmentation via Orbital Computed Tomography
Published on: November 30, 2022
3.3K
Respuesta visual localizada de preguntas visuales para escenas quirúrgicas mediante atención múltiple paralela y
IEEE journal of biomedical and health informatics
|December 25, 2025
Resumen
EndoVisLoc mejora la respuesta visual localizada de preguntas quirúrgicas (Surgical-VQLA) al mejorar el razonamiento espacial y la integración semántica. Este marco logra un rendimiento superior tanto en la precisión de la respuesta como en la localización anatómica para la educación quirúrgica.
Área de la Ciencia:
- Visión por Computadora
- Imágenes Médicas
- Educación Quirúrgica
Sus antecedentes:
- La respuesta visual localizada de preguntas quirúrgicas (Surgical-VQLA) es crucial para la educación quirúrgica, ya que requiere comprensión visual y textual.
- Los modelos actuales tienen dificultades con el razonamiento espacial y la alineación semántica intermodal en Surgical-VQLA.
- La sensibilidad espacial limitada y la integración semántica obstaculizan el rendimiento de los enfoques existentes.
Objetivo del estudio:
- Introducir EndoVisLoc, un marco novedoso diseñado para mejorar la interacción visual-textual para Surgical-VQLA.
- Mejorar la percepción de las estructuras anatómicas y facilitar una fusión intermodal robusta.
- Optimizar conjuntamente la predicción de respuestas y la localización anatómica precisa en la respuesta visual a preguntas quirúrgicas.
Principales métodos:
- Se desarrolló un Módulo de Atención Múltiple Paralela (PMAM) para capturar diversas características visuales.
- Se implementó un Módulo de Fusión Dinámica Controlada (DGFM) para la inyección adaptativa de prioridades semánticas.
- Se introdujo una Cabeza de Clasificación Jerárquica (HCH) para refinar las representaciones fusionadas y la optimización conjunta.
Principales resultados:
- EndoVisLoc superó significativamente al modelo OTAS del estado del arte en los conjuntos de datos EndoVis-18-VQLA y EndoVis-17-VQLA.
- Se lograron mejoras de +5.72% en ACC, +5.73% en F-score y +1.82% en mIoU en EndoVis-18-VQLA.
- Se demostraron ventajas consistentes tanto en la precisión de la respuesta como en la localización anatómica.
Conclusiones:
- EndoVisLoc aborda eficazmente las limitaciones en el razonamiento espacial y la integración semántica para Surgical-VQLA.
- El marco propuesto muestra un rendimiento superior y ventajas consistentes en las tareas de respuesta visual a preguntas quirúrgicas.
- EndoVisLoc ofrece una solución prometedora para avanzar en la educación quirúrgica a través de una mejor comprensión visual-textual.
