Video Experimental Relacionado
Updated: Jan 8, 2026

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
PROSHNO BINNASH: Conjunto de datos contextual de preguntas y respuestas multietiqueta para PNL de bajos recursos
Rajib Khan1, Tanjim Taharat Aurpa2, Md Saidur Rahman1
1Department of Computer Science and Engineering, International University of Business Agriculture and Technology, Uttara, Dhaka-1230, Bangladesh.
PROSHNO BINNASH es un nuevo conjunto de datos de preguntas y respuestas en bengalí para el procesamiento del lenguaje natural (PNL) de bajos recursos. Este conjunto de datos generado por humanos ayuda en el desarrollo de herramientas educativas de IA para hablantes de bengalí.
Área de la Ciencia:
- Procesamiento del Lenguaje Natural (PNL)
- Inteligencia Artificial (IA)
- Lingüística Computacional
Sus antecedentes:
- Creciente demanda de herramientas de aprendizaje automatizado en el idioma bengalí.
- Disponibilidad limitada de recursos para tareas de procesamiento del lenguaje natural (PNL) de bajos recursos en bengalí.
- Necesidad de conjuntos de datos especializados para avanzar en la tecnología educativa impulsada por IA para hablantes de bengalí.
Objetivo del estudio:
- Presentar PROSHNO BINNASH, un novedoso conjunto de datos contextual de preguntas y respuestas multietiqueta para PNL en bengalí.
- Abordar la brecha en los recursos de PNL en bengalí para aplicaciones educativas.
- Facilitar el desarrollo de herramientas educativas inclusivas impulsadas por IA para hablantes de bengalí.
Principales métodos:
- Curados 4069 entradas de textos auténticos en bengalí, incluyendo literatura y narrativas históricas.
- Anotadas cada entrada con contexto, pregunta, respuesta y clasificaciones multietiqueta en diez categorías.
- Asegurada la precisión y relevancia a través de la anotación experta de contextos, preguntas y respuestas.
Principales resultados:
- Desarrollado PROSHNO BINNASH, un conjunto de datos único que presenta anotaciones multietiqueta para preguntas y respuestas en bengalí.
- El conjunto de datos incluye diez categorías: Deportes, Salud y Ejercicio, Literatura, Persona Destacada, Película, Ciencia, Guerra de Liberación, Política, Artista e Historia.
- El conjunto de datos admite relaciones de uno a muchos entre preguntas y clases, lo que refleja la complejidad del contenido educativo.
Conclusiones:
- PROSHNO BINNASH satisface una necesidad crítica en la investigación de PNL en bengalí.
- El conjunto de datos es valioso para la educación, el análisis de bengalí, la clasificación multietiqueta y el desarrollo de chatbots académicos.
- Contribuye a avanzar en la tecnología educativa impulsada por IA para millones de hablantes de bengalí.
Videos de Conceptos Relacionados
Language and Cognition
Midrange
Simply put, the midrange is half of the data set’s range. Similar to the mean, the midrange is sensitive to the extreme values and hence the prospective outliers. However, unlike the mean, the midrange is not sensitive to all the values of the data set that lie in the middle. Thus, it is prone to...
Labeling Emotion
Language Development
The critical period for language acquisition suggests that the ability to acquire language is at its peak early in life. As people age, this proficiency decreases. Language development begins very...
Multi-species Conserved Sequences
Although the genome of each species varies greatly from each other, a few sequences are highly conserved. Such conserved...
lncRNA - Long Non-coding RNAs