Video Experimental Relacionado
Updated: Jun 15, 2026

Automated Interactive Video Playback for Studies of Animal Communication
Published on: February 9, 2011
VideoA11y: Método y conjunto de datos para la descripción de vídeo accesible
Chaoyu Li1, Sid Padmanabhuni1, Maryam S Cheema1
1School of Computing and Augmented Intelligence, Arizona State University, Tempe, Arizona, USA.
VideoA11y utiliza modelos multimodales de lenguaje grande (MLLM) para crear mejores descripciones de video para usuarios ciegos y con baja visión (BLV). Este enfoque mejora significativamente la accesibilidad y la satisfacción del usuario en comparación con los métodos actuales.
Área de la Ciencia:
- Ciencias de la computación
- Interacción hombre-ordenador
- Inteligencia artificial
Sus antecedentes:
- Las descripciones de vídeo son vitales para la accesibilidad de los usuarios ciegos y con baja visión (BLV).
- Las descripciones existentes generadas por IA a menudo carecen de calidad debido a las limitaciones de los datos de capacitación, y no satisfacen las necesidades de los usuarios de BLV.
Objetivo del estudio:
- Desarrollar un enfoque (VideoA11y) utilizando modelos multimodales de lenguaje grande (MLLM) y directrices de accesibilidad para generar descripciones de video de alta calidad para los usuarios de BLV.
- Para crear el conjunto de datos VideoA11y-40K, la mayor colección de videos descritos para usuarios de BLV.
Principales métodos:
- Aprovechar los MLLM y las directrices de accesibilidad de vídeo para generar descripciones.
- Curating el conjunto de datos VideoA11y-40K que incluye 40.000 videos descritos.
- Llevar a cabo experimentos con participantes videntes y BLV, y descriptores profesionales para evaluar la calidad de la descripción.
Principales resultados:
- Se encontró que las descripciones de VideoA11y eran superiores a las anotaciones de humanos novatos.
- Las descripciones generadas demostraron una calidad comparable a las anotaciones humanas entrenadas en claridad, precisión, objetividad, capacidad descriptiva y satisfacción del usuario.
- Los MLLM ajustados en el conjunto de datos VideoA11y-40K produjeron descripciones de video accesibles de alta calidad.
Conclusiones:
- El enfoque VideoA11y genera efectivamente descripciones de video accesibles para los usuarios de BLV.
- El conjunto de datos VideoA11y-40K y el ajuste fino MLLM avanzan en el campo de la accesibilidad de video.
- Este trabajo ofrece una solución escalable para mejorar el acceso al contenido visual para los individuos de BLV.
Más Videos Relacionados
10:11Portable Intermodal Preferential Looking IPL: Investigating Language Comprehension in Typically Developing Toddlers and Young Children with Autism
Published on: December 14, 2012
08:25Combining Eye-tracking Data with an Analysis of Video Content from Free-viewing a Video of a Walk in an Urban Park Environment
Published on: May 7, 2019
Videos de Conceptos Relacionados
Data Collection by Observations
An astronomer viewing the motion and brightness of stars in the sky and recording the data is an example of observational data collection. A botanist recording...
Data Collection I
Data Collection II
Data Reporting and Recording