Video Experimental Relacionado
Updated: Jan 21, 2026

A Porcine Model of Acute Autologous Pulmonary Embolism
Published on: September 6, 2024
Inteligencia artificial en la atención al paciente: Evaluación del rendimiento de los modelos lingüísticos grandes
Ömer F Karakoyun1, Halil E Koyuncuoğlu1, Ömer H Sağnıç2
1Department of Emergency Medicine, Muğla Training and Research Hospital, Muğla, Türkiye.
Se evaluaron cuatro modelos lingüísticos grandes (LLM) de inteligencia artificial (IA) por su capacidad para aplicar las directrices clínicas de embolia pulmonar (EP). ChatGPT-4o obtuvo el mejor resultado, pero se necesita más desarrollo para una adhesión coherente a las directrices en los flujos de trabajo de los médicos.
Área de la Ciencia:
- Informática médica
- Inteligencia artificial en la atención sanitaria
- Soporte de decisiones clínicas
Sus antecedentes:
- Los LLM impulsados por IA se integran cada vez más en la atención sanitaria para la educación del paciente.
- La eficacia de los LLM en la interpretación y aplicación de directrices clínicas complejas dentro de los flujos de trabajo reales de los médicos sigue sin evaluarse en gran medida.
- La embolia pulmonar (EP), con sus protocolos de manejo definidos, sirve como un modelo ideal para evaluar el rendimiento de los LLM en la aplicación de directrices clínicas.
Objetivo del estudio:
- Evaluar el rendimiento de cuatro LLM líderes impulsados por IA (ChatGPT-4o, DeepSeek-V2, Gemini, Grok) en la aplicación de las directrices de la Sociedad Europea de Cardiología de 2019 para la EP.
- Evaluar la precisión clínica, la adherencia a las directrices y la coherencia de las respuestas de estos LLM al presentarles un caso simulado de EP.
Principales métodos:
- Se desarrollaron diez preguntas abiertas basadas en un caso simulado de EP, que abarcaban el diagnóstico, la estratificación del riesgo, el tratamiento y el seguimiento.
- Las respuestas de los LLM fueron calificadas por dos médicos de urgencias utilizando una escala de 10 puntos frente a las respuestas de referencia basadas en las directrices.
- La fiabilidad interevaluador se evaluó utilizando el coeficiente de correlación intraclase (ICC) y las comparaciones de grupos se realizaron utilizando pruebas de Kruskal-Wallis.
Principales resultados:
- ChatGPT-4o logró la puntuación general más alta (76), seguido de Gemini (73,75), Grok (71,25) y DeepSeek-V2 (65), sin diferencias estadísticamente significativas en las puntuaciones totales (P = 0,390).
- El rendimiento varió entre categorías, destacando ChatGPT-4o en el seguimiento y DeepSeek-V2 en el diagnóstico.
- Los revisores expertos señalaron puntos fuertes como las respuestas estructuradas de ChatGPT-4o y la practicidad de Grok, al tiempo que identificaron limitaciones como una personalización insuficiente y lagunas en las directrices.
- El acuerdo interevaluador fue excelente (ICC: 0,986).
Conclusiones:
- Los LLM impulsados por IA demuestran una utilidad potencial para apoyar el manejo de la embolia pulmonar.
- Ningún LLM superó consistentemente a otros en todos los dominios evaluados del manejo de la EP.
- Son necesarios avances adicionales para mejorar la integración clínica y el cumplimiento coherente de las directrices de los LLM en los entornos sanitarios.
Más Videos Relacionados
08:02Establishment of a Minimally Invasive Rat Model of Pulmonary Embolism Using Autologous Blood Clots
Published on: October 25, 2024
06:15Protocol and Guidelines for Point-of-Care Lung Ultrasound in Diagnosing Neonatal Pulmonary Diseases Based on International Expert Consensus
Published on: March 6, 2019
Videos de Conceptos Relacionados
Pulmonary Embolism II: Diagnostic Studies and Interprofessional Care
Pulmonary Embolism I: Introduction
Pulmonary Embolism III: Nursing Management
Patient-centered Care
The Evidence for Evolution
Language
Corballis and Suddendorf (2007) and Tomasello and Rakoczy (2003) highlight the role of language in...