Video Experimental Relacionado
Updated: Sep 9, 2025

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
Comparación rápida de grandes modelos de lenguaje para el diagnóstico de pacientes con comorbilidades: estudio
Peter Sarvari1, Zaid Al-Fagih1
1Rhazes AI, First Floor, 85 Great Portland Street, London, W1W 7LT, United Kingdom.
Gemini 2.5 demostró una precisión de diagnóstico superior entre 21 modelos de lenguaje grande (LLM) evaluados en datos reales de pacientes. Este estudio pone de relieve el potencial de los LLM para mejorar el diagnóstico médico, aunque se necesita más investigación.
Área de la Ciencia:
- La inteligencia artificial en la medicina
- Sistemas de apoyo a la toma de decisiones clínicas
- Procesamiento del lenguaje natural para la salud
Sus antecedentes:
- Los errores de diagnóstico contribuyen a una mortalidad significativa de los pacientes, que representa la tercera causa de muerte en los Estados Unidos.
- Los grandes modelos de lenguaje (LLM) son prometedores para ayudar a los médicos con los diagnósticos, pero faltan datos comparativos de rendimiento en cohortes de pacientes del mundo real.
Objetivo del estudio:
- Comparar las capacidades de diagnóstico de 18 modelos populares de lenguaje grande (LLM) utilizando un conjunto de datos de pacientes del mundo real.
- Evaluar el impacto de las diferentes indicaciones y ajustes de temperatura en el rendimiento de diagnóstico de LLM.
- Evaluar la efectividad de la generación aumentada de recuperación (RAG) para mejorar la precisión del diagnóstico de LLM.
Principales métodos:
- Se evaluaron 21 LLM en 1000 pacientes hospitalizados seleccionados al azar en el Centro de Información Médica para Cuidados Intensivos-IV (MIMIC-IV).
- Empleó un enfoque de LLM como juez para la evaluación automatizada, comparando los diagnósticos generados por LLM con los códigos diagnósticos finales de los registros de pacientes.
- Se calcularon las tasas de aciertos diagnósticos y se evaluó la significación estadística utilizando pruebas z agrupadas para las proporciones.
Principales resultados:
- Gemini 2.5 logró la tasa de acierto de diagnóstico más alta (97,4%) cuando se evaluó con GPT-4.1, superando a otros modelos líderes como GPT-4.1 y Claude-4 Opus.
- GPT-4.1 mostró el mayor rendimiento en evaluaciones separadas por GPT-4 Turbo, lo que indica variabilidad en la evaluación dependiendo del juez LLM.
- La generación aumentada de recuperación (RAG) mejoró significativamente la tasa de éxito de GPT-4o 05-13 en un 0,8% (P < 0,006), y el rendimiento varió según las diferentes indicaciones.
Conclusiones:
- Los LLM demuestran un potencial significativo para mejorar la precisión del diagnóstico en entornos clínicos.
- La investigación adicional con diversos conjuntos de datos y la validación clínica es esencial para comprender e implementar completamente las herramientas de diagnóstico de LLM.
- La estrecha colaboración entre los desarrolladores de IA y los médicos es crucial para la integración responsable de los LLM en la atención médica.
Más Videos Relacionados
06:48Lexical Decision Task for Studying Written Word Recognition in Adults with and without Dementia or Mild Cognitive Impairment
Published on: June 25, 2019
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
Videos de Conceptos Relacionados
Classification of Illness
An illness is a response to a disease in which the person's level of functioning is changed compared with a previous level. The general classification of illness includes acute and chronic.
Acute illness is severe...
One-Compartment Open Model: Wagner-Nelson and Loo Riegelman Method for ka Estimation
On...
Mechanistic Models: Compartment Models in Individual and Population Analysis