Video Experimental Relacionado
Updated: Jan 8, 2026

A Swin Transformer-Based Model for Thyroid Nodule Detection in Ultrasound Images
Published on: April 21, 2023
Un método de explicabilidad de la visión para la generación de subtítulos de imágenes utilizando mapas de atención
Meena Kowshalya1, Suchitra2, Rajesh Kumar Dhanaraj3
1Department of Computer Science and Engineering, Government College of Technology, Coimbatore, India.
Este estudio presenta un marco de subtitulado de imágenes explicable que utiliza un codificador de red neuronal convolucional y un decodificador Transformer. Mejora la transparencia en la toma de decisiones de la IA para aplicaciones confiables.
Área de la Ciencia:
- Inteligencia Artificial
- Visión por Computadora
- Procesamiento del Lenguaje Natural
Sus antecedentes:
- Los modelos de generación de subtítulos de imágenes a menudo funcionan como cajas negras, careciendo de transparencia en sus procesos de toma de decisiones.
- Existe la necesidad de IA explicable (XAI) en modelos de visión y lenguaje para generar confianza y fiabilidad.
Objetivo del estudio:
- Desarrollar un marco novedoso y explicable para la generación de subtítulos de imágenes que integre la explicabilidad visual.
- Abordar la brecha de transparencia en los modelos actuales de visión y lenguaje.
Principales métodos:
- Se utilizó un codificador de red neuronal convolucional (CNN) y una arquitectura de decodificador Transformer.
- Se integraron mapas de calor basados en la atención para proporcionar explicaciones visuales de los subtítulos generados.
- Se evaluó el rendimiento y la interpretabilidad en el conjunto de datos MS COCO utilizando métricas estándar (BLEU, METEOR, CIDER, SPICE).
Principales resultados:
- El marco propuesto ofrece transparencia en el proceso de toma de decisiones de la generación de subtítulos de imágenes.
- Los mapas de calor basados en la atención resaltan de manera efectiva las características visuales que influyen en la generación de subtítulos.
- El método equilibra la calidad de la generación de subtítulos con una mayor interpretabilidad.
Conclusiones:
- El marco desarrollado aumenta la confiabilidad y la transparencia en los sistemas de IA.
- Este enfoque es adecuado para aplicaciones críticas en atención médica, educación, seguridad y pronósticos.
- Contribuye al avance de la IA explicable al tender un puente entre el rendimiento y la interpretabilidad en los modelos de visión y lenguaje.
Videos de Conceptos Relacionados
Transformers
The iron core has a substantial relative permeability. Therefore, the magnetic field lines generated due to the current in one winding are almost entirely confined within the core, such that the same magnetic flux permeates each turn of both...
Types Of Transformers
If the ratio of the number of turns in the secondary winding to that of the primary winding is greater than one, then the transformer is said to be a step-up transformer. In a step-up transformer, the voltage at the secondary winding is greater than the voltage applied at the primary winding.
However, if this ratio is less than one, the transformer is said to be a step-down...
Transformers in Distribution System
Distribution substation transformers come in various ratings and typically use mineral oil for insulation and cooling. To prevent moisture and air from entering the oil, some transformers use an inert gas like nitrogen to fill the...
Deconvolution
Deconvolution involves several mathematical techniques to derive the impulse response. One common approach is polynomial division. In this method, the input and output sequences are treated as coefficients of...
Transformers with Off-Nominal Turns Ratios
Three-Winding Transformers
In the per-unit equivalent circuit of a grounded Y-Y three-phase...