Video Experimental Relacionado
Updated: Jan 7, 2026

Capturing Dynamic Finger Gesturing with High-resolution Surface Electromyography and Computer Vision
Published on: March 28, 2025
Híbrido de convolución y transformador de visión para el reconocimiento robusto de gestos de mano sEMG de bajo canal:
Ruthber Rodriguez Serrezuela1, Roberto Sagaro Zamora2, Daily Milanes Hermosilla3
1Department of Mechatronics Engineering, University Corporation of Huila, Neiva 410001, Colombia.
Un transformador de visión convolucional (CViT) muestra un rendimiento superior a una red neuronal convolucional clásica (CNN) para la clasificación de gestos de mano utilizando señales de electromiografía de superficie (sEMG) de bajo canal. Este avance es clave para el desarrollo de sistemas de control protésico compactos.
Área de la Ciencia:
- Ingeniería Biomédica
- Aprendizaje Automático
- Tecnología de Rehabilitación
Sus antecedentes:
- La electromiografía de superficie (sEMG) es crucial para el control protésico y la interacción humano-máquina.
- Los estudios de sEMG existentes a menudo utilizan grabaciones de alta densidad o conjuntos de gestos extensos, lo que limita los datos sobre sistemas de bajo canal y gestos reducidos.
- Los sistemas sEMG compactos requieren modelos de clasificación eficientes para aplicaciones protésicas prácticas.
Objetivo del estudio:
- Evaluar comparativamente una red neuronal convolucional (CNN) clásica con un transformador de visión convolucional (CViT) para la clasificación de gestos de mano en sistemas sEMG de bajo canal.
- Evaluar el rendimiento del modelo en conjuntos de datos de no amputados y amputados de transradial.
- Determinar las capacidades de robustez y generalización de las arquitecturas CNN y CViT en condiciones sEMG desafiantes.
Principales métodos:
- Se utilizaron dos conjuntos de datos: un conjunto de datos propietario de Myo de 8 canales y un subconjunto de 12 canales de NinaPro DB3 de amputados de transradial.
- Tanto los modelos CNN como CViT se entrenaron utilizando preprocesamiento estandarizado idéntico, segmentación y ventanas equilibradas.
- Se comparó la precisión del modelo en los conjuntos de datos, centrándose en el rendimiento en escenarios de señales sEMG heterogéneas y de bajo canal.
Principales resultados:
- La CNN logró una precisión del 94,2 % en el conjunto de datos Myo, pero mostró variabilidad (precisión del 92,0 %) en el conjunto de datos de amputados NinaPro.
- El modelo CViT igualó o superó consistentemente el rendimiento de la CNN, logrando una precisión del 96,6 % en Myo y del 94,2 % en NinaPro.
- El análisis estadístico indicó diferencias significativas en el rendimiento en el conjunto de datos Myo, y CViT demostró resultados superiores.
Conclusiones:
- El transformador de visión convolucional (CViT) ofrece una mayor robustez y generalización en comparación con las CNN clásicas para la clasificación de gestos de mano sEMG de bajo canal.
- El rendimiento de CViT es particularmente ventajoso en condiciones de señal heterogéneas, como las encontradas con grabaciones de amputados.
- Estos hallazgos resaltan la idoneidad de CViT para el desarrollo de sistemas de control protésico avanzados y compactos.