Video Experimental Relacionado
Updated: Sep 9, 2025

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
Probabilidades de token para mitigar grandes modelos de lenguaje Exceso de confianza en la respuesta a preguntas
Raphaël Bentegeac1,2, Bastien Le Guellec3,4, Grégory Kuchcinski3,4
1Department of Public Health, Lille University, Lille University Hospital Center, avenue du Professeur Emile Laine, Lille, 59037, France.
Los chatbots médicos a menudo expresan una gran confianza pero no son confiables. Las probabilidades simbólicas, no la certeza autoevaluada, predicen mejor la precisión del chatbot para preguntas médicas, ofreciendo una evaluación más confiable.
Área de la Ciencia:
- La inteligencia artificial en la medicina
- Procesamiento del lenguaje natural
- La informática médica
Sus antecedentes:
- Los chatbots son prometedores en medicina, pasando los exámenes de la junta médica.
- Sin embargo, su excesiva confianza en las respuestas incorrectas limita su uso clínico.
Objetivo del estudio:
- Para comparar las probabilidades simbólicas con la confianza expresada por los chatbots para predecir la precisión de la respuesta médica.
- Evaluar si las probabilidades simbólicas son superiores a la confianza autoinformada en la evaluación del rendimiento del chatbot.
Principales métodos:
- Nueve grandes modelos de lenguaje (LLM) respondieron a 2522 preguntas del examen de licencia médica de los Estados Unidos.
- Se registraron y analizaron la confianza del modelo y la probabilidad del token de respuesta.
- El rendimiento predictivo se evaluó utilizando AUROC, error de calibración y puntuación Brier.
Principales resultados:
- La precisión del chatbot varió, con GPT-4o logrando el 89% y Phi-3-Mini el 56,5%.
- Precisión de las predicciones de confianza expresa (AUROC 0,52-0,68).
- Las probabilidades de tokens superaron constantemente la confianza (AUROC 0.71-0.87), lo que indica una mejor precisión en la predicción.
Conclusiones:
- Los chatbots luchan con la autoevaluación precisa de la confianza en contextos médicos.
- Las probabilidades de tokens ofrecen un método más confiable para evaluar la precisión de la respuesta del chatbot.
- Los médicos no deben confiar en la certeza de autoevaluación del chatbot; las probabilidades simbólicas son una mejor alternativa.
Más Videos Relacionados
Videos de Conceptos Relacionados
Improving Translational Accuracy
The Availability Heuristic
Sensitivity, Specificity, and Predicted Value
Sensitivity is the...
Uncertainty: Confidence Intervals
Microorganisms in Medicine and Therapeutics
Testing a Claim about Population Proportion
There are two methods of testing a claim about a population proportion: (1) Using the sample proportion from the data where a binomial distribution is approximated to the normal distribution and (2) Using the binomial probabilities calculated from the data.
The first method uses normal distribution as an approximation to the binomial distribution. The requirements are as follows: sample size is large...

