Video Experimental Relacionado
Updated: Feb 26, 2026

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
Evaluación de la precisión de las versiones del modelo ChatGPT para dar consejos sobre la búsqueda de atención médica
Marvin Kopka1, Longqi He2, Markus A Feufel2
1Division of Ergonomics, Department of Psychology and Ergonomics (IPA), Technische Universität Berlin, Berlin, Germany. marvin.kopka@tu-berlin.de.
Los modelos ChatGPT muestran una precisión limitada en los consejos sobre la búsqueda de atención médica. Si bien las versiones más nuevas ofrecen sugerencias de autocuidado, su fiabilidad es insuficiente para su uso independiente. La agregación de resultados puede mejorar el rendimiento.
Área de la Ciencia:
- Inteligencia Artificial en la Atención Médica
- Sistemas de Apoyo a la Toma de Decisiones Médicas
- Procesamiento del Lenguaje Natural
Sus antecedentes:
- Las personas utilizan cada vez más herramientas de IA como ChatGPT para tomar decisiones sobre su salud.
- La precisión de los consejos de búsqueda de atención médica generados por IA, especialmente de los modelos más nuevos, requiere una evaluación exhaustiva.
- La investigación existente no ha evaluado exhaustivamente todos los modelos de ChatGPT disponibles para la precisión de los consejos médicos.
Objetivo del estudio:
- Evaluar la precisión de los consejos de búsqueda de atención médica proporcionados por todos los modelos ChatGPT disponibles actualmente.
- Comparar el rendimiento de diferentes versiones de ChatGPT en la clasificación de la urgencia médica.
- Explorar métodos para mejorar la precisión de los consejos médicos generados por IA.
Principales métodos:
- Se evaluaron 22 modelos de ChatGPT utilizando 45 viñetas validadas, y cada viñeta se solicitó 10 veces (9900 evaluaciones totales).
- Se clasificó la urgencia de la viñeta en categorías de atención de emergencia, atención no de emergencia o autocuidado.
- Se validaron las recomendaciones de IA frente a un estándar de oro establecido por dos médicos y se probaron algoritmos de agregación.
Principales resultados:
- El modelo o1-mini demostró la mayor precisión con un 74 %.
- No se observó una mejora constante de la precisión en los modelos ChatGPT más nuevos.
- Los modelos de razonamiento mostraron una mejor identificación de casos de autocuidado; la agregación de resultados mejoró la precisión en un 4 %.
- La selección del nivel de urgencia más bajo entre múltiples pruebas mejoró la precisión general.
Conclusiones:
- Los modelos actuales de ChatGPT proporcionan una precisión insuficiente para el uso independiente en decisiones de búsqueda de atención médica.
- Los modelos de IA más nuevos ofrecen cada vez más consejos de autocuidado, pero la fiabilidad sigue siendo una preocupación.
- El uso de algoritmos de agregación para aprovechar la variabilidad de los resultados puede mejorar significativamente el rendimiento de los modelos de IA existentes.
Más Videos Relacionados
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
07:31Implementation of a Real-Time Psychosis Risk Detection and Alerting System Based on Electronic Health Records using CogStack
Published on: May 15, 2020
Videos de Conceptos Relacionados
Accuracy, limits, and approximation
Accuracy is defined as the closeness of the measured value to the true or actual value. In engineering mechanics, repeated measurements are taken during theoretical or experimental analyses to ensure that the result is precise and accurate.
The accuracy of any solution is based on the...
Improving Translational Accuracy
Improving Translational Accuracy
Accuracy and Errors in Hypothesis Testing
In hypothesis testing, the probability of making a Type I error, denoted as α, is commonly set at 0.05. This significance level indicates a 5%...
Prediction Intervals
However, the point estimate is most likely not the exact value of the population parameter, but close to it. After calculating point estimates, we construct interval estimates, called confidence intervals or prediction intervals. This prediction interval comprises a range of values unlike the point estimate and is a better predictor of the observed sample value, y.
Accuracy and Precision