Video Experimental Relacionado
Updated: Jan 27, 2026

Analyzing Mitochondrial Morphology Through Simulation Supervised Learning
Published on: March 3, 2023
Mejora de la precisión y la explicabilidad en la clasificación de lesiones colorrectales con Vision Transformers
Luca Carlini1, Luca Di Stefano1, Chiara Lena1
1Dipartimento di Elettronica, Informazione, Bioingegneria (DEIB), Politecnico di Milano, Piazza Leonardo da Vinci, 32, Milano, 20133, Italy.
La supervisión de los mapas de atención de Vision Transformer (ViT) con anotaciones expertas mejora la precisión y la interpretabilidad de la clasificación de lesiones colorrectales. Este método mejora el rendimiento de la clasificación de París y proporciona patrones de atención más claros y centrados en la lesión para una mejor toma de decisiones clínicas.
Área de la Ciencia:
- Inteligencia Artificial en Medicina; Visión por Computadora para Endoscopia; Análisis de Imágenes Médicas
Sus antecedentes:
- La evaluación precisa de las lesiones colorrectales es crucial para el tratamiento y la estratificación del riesgo de cáncer.; La clasificación de París ayuda en esta evaluación, pero presenta variabilidad interobservador.; Los transformadores de visión (ViTs) ofrecen potencial pero pueden exhibir atención difusa, lo que dificulta la interpretabilidad.
Objetivo del estudio:
- Investigar si la supervisión de los mapas de atención de ViT con anotaciones expertas mejora la precisión de la clasificación de París.; Mejorar la interpretabilidad de los modelos ViT centrándola en las regiones de lesión relevantes.; Desarrollar un método que mejore simultáneamente el rendimiento de la clasificación y la explicabilidad del modelo.
Principales métodos:
- Se propuso un objetivo de preentrenamiento de Pérdida de Atención Enfocada en Lesiones (LLFA).; Se utilizaron cuadros delimitadores de pólipos expertos para guiar la atención de ViT hacia las áreas de lesión anotadas.; Se aplicó LLFA a seis arquitecturas ViT, seguido de ajuste fino de entropía cruzada en el conjunto de datos SUN para la clasificación de París.
Principales resultados:
- El preentrenamiento con supervisión de atención mejoró consistentemente la precisión y la atención centrada en la lesión en todos los modelos ViT.; LLFA mejoró la precisión de la clasificación de París de tres clases hasta en 7 puntos porcentuales.; LLFA superó a una línea de base de consistencia de Grad-CAM en 5-13 puntos porcentuales, con una asociación significativa entre la atención enfocada y las predicciones correctas.
Conclusiones:
- La supervisión directa de la atención de ViT con LLFA aprovecha eficazmente el conocimiento experto.; Este enfoque mejora conjuntamente la precisión de la clasificación de París y la interpretabilidad espacial.; LLFA demuestra un rendimiento superior en comparación con la regularización de explicaciones basada en Grad-CAM.
Videos de Conceptos Relacionados
Vision
Improving Translational Accuracy
Improving Translational Accuracy
Uncertainty in Measurement: Accuracy and Precision
Color Vision
Bacterial Transformation
Griffith made an unexpected discovery when he killed the pathogenic strain and mixed its remains with the live, non-pathogenic strain. Not only did the mixture kill host mice, but it also contained living pathogenic bacteria that...

