Video Experimental Relacionado
Updated: May 1, 2026

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
ViSQA: Un conjunto de datos de referencia y modelos base para la respuesta a preguntas habladas en vietnamita
Le Trong Minh1,2, Nguyen Duc Thinh2, Nguyen Khanh Tho Loc1,2
1VNU University of Engineering and Technology, Vietnam National University, Hanoi, Vietnam.
Este estudio presenta ViSQA, un nuevo punto de referencia para la respuesta a preguntas habladas en vietnamita. Demuestra que los errores de reconocimiento automático del habla afectan significativamente el rendimiento, pero el entrenamiento con datos hablados mejora la robustez.
Área de la Ciencia:
- Procesamiento del Lenguaje Natural
- Reconocimiento del Habla
- Aprendizaje Automático
Sus antecedentes:
- La respuesta a preguntas habladas (SQA) integra el reconocimiento automático del habla (ASR) y la comprensión del lenguaje.
- Los puntos de referencia SQA existentes son limitados para idiomas de bajos recursos como el vietnamita.
- El SQA vietnamita carece de conjuntos de datos estandarizados para investigación y desarrollo.
Objetivo del estudio:
- Presentar ViSQA, el primer conjunto de datos de referencia para la respuesta a preguntas habladas en vietnamita.
- Permitir la evaluación sistemática de modelos SQA bajo una calidad variable de transcripción de reconocimiento automático del habla (ASR).
- Facilitar la investigación sobre el impacto de los errores de ASR en las tareas de comprensión del lenguaje posteriores.
Principales métodos:
- Se amplió el corpus UIT-ViQuAD utilizando un pipeline de texto a voz y ASR.
- Se crearon más de 13.000 pares de preguntas y respuestas con audio hablado alineado.
- Se incluyeron variantes de audio limpias y degradadas por ruido para una evaluación robusta.
- Se realizaron experimentos con cinco modelos basados en transformadores.
Principales resultados:
- Los errores de reconocimiento automático del habla (ASR) degradan sustancialmente el rendimiento del modelo SQA (por ejemplo, ViT5 EM: del 62,04% al 36,30%).
- Entrenar modelos con transcripciones habladas mejora la robustez contra los errores de ASR (por ejemplo, ViT5 EM: del 36,30% al 50,70%).
- Se demostró una caída significativa del rendimiento debido a imprecisiones en la transcripción.
Conclusiones:
- ViSQA sirve como un punto de referencia riguroso para los sistemas de respuesta a preguntas habladas en vietnamita.
- Destaca el impacto crítico de la calidad del ASR en el rendimiento del SQA.
- Proporciona una base para el desarrollo de modelos SQA más robustos para el vietnamita.
Videos de Conceptos Relacionados
Data Collection by Survey
Stratified Sampling Method
To choose a stratified sample, divide the population into groups called strata and then take a...
Types of Surveys
Typical Model Studies
Language Development
The critical period for language acquisition suggests that the ability to acquire language is at its peak early in life. As people age, this proficiency decreases. Language development begins very...
Cochran's Q Test
