Video Experimental Relacionado
Updated: Jul 30, 2026

04:23
A Swin Transformer-Based Model for Thyroid Nodule Detection in Ultrasound Images
Published on: April 21, 2023
2.2K
Un nuevo modelo CvT basado en deep transformer para el reconocimiento del lenguaje de señas en la comunicación visual
Scientific reports
|December 21, 2025
Resumen
Un nuevo modelo Convolutional Vision Transformer (CvT) mejora significativamente la precisión del reconocimiento del lenguaje de señas (SLR) al 99%. Este avance de la IA mejora la accesibilidad de la comunicación para las comunidades sordas y con problemas de audición al superar las limitaciones de los métodos tradicionales.
Área de la Ciencia:
- Visión por computadora
- Inteligencia artificial
- Aprendizaje automático
Sus antecedentes:
- El reconocimiento del lenguaje de señas (SLR) es vital para las comunidades sordas y con problemas de audición.
- Los modelos tradicionales de IA y aprendizaje profundo enfrentan desafíos con gestos complejos, iluminación y oclusiones.
- Los transformadores de visión (ViT) ofrecen una extracción avanzada de características a través de la autoatención, modelando eficazmente las dependencias a largo plazo.
Objetivo del estudio:
- Desarrollar un modelo de IA avanzado para el reconocimiento preciso y robusto del lenguaje de señas.
- Integrar mecanismos convolucionales y de transformadores para una extracción de características optimizada.
- Evaluar el rendimiento del modelo propuesto frente a los métodos actuales de vanguardia.
Principales métodos:
- Se propuso un modelo Convolutional Vision Transformer (CvT), que combina la tokenización convolucional jerárquica con la atención del transformador.
- El modelo CvT se entrenó y evaluó en conjuntos de datos de dígitos del lenguaje de señas y alfabetos/símbolos.
- El rendimiento se comparó con redes neuronales convolucionales (CNN) tradicionales y modelos basados en transformadores como BeIT.
Principales resultados:
- El modelo CvT propuesto logró una precisión del 99% en ambos conjuntos de datos evaluados.
- CvT demostró un rendimiento superior en comparación con los modelos base de CNN y BeIT.
- El modelo redujo efectivamente las clasificaciones erróneas y mejoró la confianza predictiva y la generalización.
Conclusiones:
- El modelo CvT representa un avance significativo en el reconocimiento automatizado del lenguaje de señas.
- Este enfoque de IA mejora la precisión y la confiabilidad de los sistemas SLR.
- Los hallazgos respaldan el potencial de CvT para tecnologías de comunicación más inclusivas.