Video Experimental Relacionado
Updated: Jun 11, 2026

04:23
A Swin Transformer-Based Model for Thyroid Nodule Detection in Ultrasound Images
Published on: April 21, 2023
2.3K
Un marco híbrido Transformer-CNN para la clasificación multiclas de enfermedades oculares semi-supervisada guiada por
Muhammad Hammad Malik1, Zishuo Wan1, Yingying Ren2
1School of Automation and Electrical Engineering, University of Science and Technology Beijing, Beijing 100083, China.
Resumen
Este estudio presenta un novedoso modelo de IA para clasificar enfermedades oculares a partir de imágenes de fondo de ojo, logrando una alta precisión e interpretabilidad. El enfoque mejora el diagnóstico y tratamiento tempranos para prevenir la pérdida de visión.
Área de la Ciencia:
- Oftalmología e Imagen Médica
- Inteligencia Artificial en la Atención Médica
- Aprendizaje Profundo para la Clasificación de Enfermedades
Sus antecedentes:
- La clasificación precisa de enfermedades oculares como cataratas, retinopatía diabética (DR) y glaucoma a partir de imágenes de fondo de ojo es crucial para prevenir la pérdida de visión.
- Los métodos de aprendizaje profundo existentes enfrentan desafíos con grandes conjuntos de datos etiquetados, utilización ineficiente de datos no etiquetados e interpretabilidad limitada, lo que dificulta la aplicación clínica.
Objetivo del estudio:
- Desarrollar una novedosa arquitectura híbrida CNN-Transformer para mejorar la clasificación multiclas de enfermedades oculares.
- Mejorar la utilización de datos etiquetados y no etiquetados a través de un innovador aprendizaje semi-supervisado (SSL).
- Mejorar la interpretabilidad del modelo para la validación clínica y la confianza.
Principales métodos:
- Una arquitectura híbrida CNN-Transformer (backbone ConvNeXt con módulos Transformer) que utiliza atención de múltiples cabezales para la captura de características espaciales y de largo alcance.
- Marco SSL Uncertainty-Guided MixMatch (UG-MixMatch) que emplea Monte Carlo (MC) dropout para la cuantificación de la incertidumbre y el refinamiento de pseudo-etiquetas.
- Integrated Attention Map (GIAM) basado en gradientes para predicciones interpretables, que agrega mapas de atención con ponderación adaptativa por canal.
Principales resultados:
- Logró una precisión de clasificación del 95,27 % con UG-MixMatch y del 95,51 % con MC dropout en el conjunto de datos Ocular Imaging Health (OIH).
- Demostró una concordancia casi perfecta con la verdad fundamental (puntuación kappa de Cohen de 93,70).
- Rendimiento excepcional por clase, incluida una sensibilidad/especificidad del 100 % para DR y una alta especificidad para cataratas y glaucoma, con valores AUC sólidos.
Conclusiones:
- El marco propuesto aborda eficazmente la escasez de datos y mejora la interpretabilidad en la clasificación de enfermedades oculares.
- El modelo híbrido ofrece un rendimiento clínicamente relevante, lo que representa un paso prometedor hacia herramientas de diagnóstico escalables, explicables y precisas.
- Las visualizaciones de GIAM proporcionan una interpretabilidad clínica mejorada, validando las predicciones del modelo para su posible uso en Sistemas de Soporte de Decisiones Clínicas (CDSS).