Video Experimental Relacionado
Updated: Feb 20, 2026

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
Sobre la consistencia de la puntuación automática con modelos de lenguaje grandes
Mingfeng Xue1, Xingyao Xiao2, Yunting Liu3
1University of North Carolina Greensboro, USA.
Los modelos de lenguaje grandes (LLM) muestran una alta consistencia intra-LLM en la puntuación, pero la consistencia inter-LLM es moderada. Una estrategia de votación que combina los resultados de los LLM mejora la precisión de la puntuación.
Área de la Ciencia:
- Inteligencia Artificial
- Medición Educativa
- Procesamiento del Lenguaje Natural
Sus antecedentes:
- Los modelos de lenguaje grandes (LLM) demuestran potencial para tareas de puntuación automatizada.
- La inconsistencia en la puntuación de los LLM puede surgir de variaciones en el modelo y diferencias en los datos de entrenamiento.
- Comprender la consistencia de la puntuación de los LLM es crucial para una evaluación automatizada confiable.
Objetivo del estudio:
- Investigar la consistencia de la puntuación intra-LLM e inter-LLM en cinco LLM.
- Examinar el impacto de la configuración de la temperatura en la consistencia de la puntuación de los LLM.
- Evaluar la relación entre la consistencia de la puntuación y la precisión.
- Proponer y evaluar una estrategia de votación para mejorar la puntuación de los LLM.
Principales métodos:
- Se evaluó la consistencia de la puntuación de cinco LLM (Claude, DeepSeek, Gemini, GPT, Qwen).
- Se evaluó la consistencia en diferentes configuraciones de temperatura.
- Se utilizaron ítems de respuesta construida de los conjuntos de datos de educación científica y ASAP.
- Se implementó una estrategia de votación mayoritaria entre los LLM.
Principales resultados:
- Los LLM exhibieron una consistencia intra-LLM casi perfecta, independientemente de la temperatura.
- La consistencia inter-LLM fue moderada, mayor para ítems más fáciles.
- La consistencia intra-LLM superó la consistencia inter-LLM.
- La consistencia intra-LLM no se correlacionó con la precisión; la consistencia inter-LLM mostró una correlación positiva.
- La votación mayoritaria mejoró la precisión de la puntuación al combinar las diversas fortalezas de los LLM.
Conclusiones:
- Los LLM ofrecen una alta fiabilidad interna de puntuación pero un acuerdo externo variable.
- La consistencia inter-LLM es un mejor predictor de la precisión de la puntuación que la consistencia intra-LLM.
- Los métodos de conjunto, como la votación mayoritaria, pueden mitigar las inconsistencias de puntuación de los LLM y mejorar la precisión en las evaluaciones educativas.
Videos de Conceptos Relacionados
Improving Translational Accuracy
Improving Translational Accuracy
Automatic Processing and Automatic Social Behavior
Language and Cognition
Language Development
The critical period for language acquisition suggests that the ability to acquire language is at its peak early in life. As people age, this proficiency decreases. Language development begins very...
Accuracy, limits, and approximation
Accuracy is defined as the closeness of the measured value to the true or actual value. In engineering mechanics, repeated measurements are taken during theoretical or experimental analyses to ensure that the result is precise and accurate.
The accuracy of any solution is based on the...