Video Experimental Relacionado
Updated: Sep 9, 2025

03:14
Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
681
Factibilidad de la puntuación de evaluación impulsada por IA: ¿Pueden los grandes modelos de lenguaje reemplazar a
Michael Jaworski1, Jacob Balconi2, Celeste Santivasci3
1Department of Psychology, Louisiana State University, Baton Rouge, LA, USA.
The Clinical neuropsychologist
|September 1, 2025
Resumen
ChatGPT-4.5 muestra una alta precisión en la puntuación de la Breve Evaluación Cognitiva Internacional para la Esclerosis Múltiple (BICAMS) antes de su publicación pública. Sin embargo, su fiabilidad disminuyó después de la liberación, lo que indica el potencial de LLM en la evaluación neuropsicológica con optimización.
Área de la Ciencia:
- La neurociencia
- Inteligencia artificial
- La informática médica
Sus antecedentes:
- Las evaluaciones neuropsicológicas como la Breve Evaluación Cognitiva Internacional para la Esclerosis Múltiple (BICAMS) son cruciales para monitorear la progresión de la enfermedad.
- La puntuación manual de estas evaluaciones requiere mucho tiempo y es propensa a errores humanos.
- Los grandes modelos de lenguaje (LLM) ofrecen el potencial para automatizar tales tareas.
Objetivo del estudio:
- Evaluar la viabilidad, precisión y fiabilidad del uso de ChatGPT-4.5 para la puntuación automatizada de los protocolos BICAMS.
- Para comparar el rendimiento de puntuación de ChatGPT-4.5 con los evaluadores humanos.
Principales métodos:
- Treinta y cinco protocolos BICAMS no identificados (incluidos SDMT, CVLT-II, BVMT-R) fueron calificados por dos evaluadores humanos y ChatGPT-4.5.
- La puntuación incluyó la carga de escaneos de protocolo y el uso de instrucciones estructuradas para ChatGPT-4.5.
- La fiabilidad, la precisión y la velocidad de los interrater se evaluaron utilizando CCI, pruebas t y estadísticas descriptivas.
Principales resultados:
- Antes de su lanzamiento al público, ChatGPT-4.5 demostró una gran fiabilidad entre evaluadores con evaluadores humanos (por ejemplo, CVLT-II ICC = 0.992, SDMT ICC = 1.000).
- ChatGPT-4.5 completó la puntuación en menos de 9 minutos por protocolo e identificó errores que no fueron detectados por los evaluadores humanos.
- Después de la publicación pública, la fiabilidad disminuyó significativamente (por ejemplo, BVMT-R Trial 3 ICC = -0.046), y las discrepancias de puntuación aumentaron.
Conclusiones:
- ChatGPT-4.5 mostró una precisión comparable a los evaluadores humanos en la puntuación de los protocolos BICAMS, particularmente antes de su lanzamiento público.
- La variabilidad del rendimiento surgió después de la publicación pública, destacando la necesidad de un modelo y una optimización rápida.
- Los LLM son prometedores para racionalizar las evaluaciones neuropsicológicas, mejorar la eficiencia y reducir los errores, siempre que los recursos computacionales y la optimización sean adecuados.
Palabras clave:
ChatGPT (en inglés)puntuación automáticafiabilidad entre tasadoresModelos de lenguaje grande (LLMS)Psicometría
