Video Experimental Relacionado
Updated: Sep 10, 2025

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
Desempeño diagnóstico de modelos de lenguaje de gran tamaño recientemente desarrollados en casos de enfermedad
Xintong Wu1, Yu Huang1, Qing He1
1Department of Intensive Care Medicine, Affiliated Hospital of Southwest Jiaotong University, The Third People's Hospital of Chengdu, Chengdu, Sichuan, China.
Los modelos de lenguaje de gran tamaño (LLM) recientemente desarrollados son prometedores para el apoyo a las decisiones clínicas en las unidades de cuidados intensivos (UCI). ChatGPT-o3 lideró en precisión de diagnóstico, y DeepSeek-R1 de código abierto también tuvo un desempeño competitivo.
Área de la Ciencia:
- La inteligencia artificial en la medicina
- Sistemas de apoyo a la toma de decisiones clínicas
- Medicina de cuidados intensivos
Sus antecedentes:
- Los grandes modelos de lenguaje (LLM) muestran potencial para el apoyo a la decisión clínica.
- El rendimiento diagnóstico de LLM en unidades de cuidados intensivos (UCI) no se ha explorado.
- Este estudio evalúa los LLM recién desarrollados para el diagnóstico de enfermedades críticas.
Objetivo del estudio:
- Evaluar la precisión del diagnóstico de cuatro nuevos LLM en casos de enfermedad crítica.
- Comparar la calidad del diagnóstico diferencial y la calidad de la respuesta de estos LLM.
- Identificar los LLM más efectivos para el apoyo a la decisión clínica en la UCI.
Principales métodos:
- Un estudio comparativo transversal evaluó cuatro LLM: ChatGPT-4o, ChatGPT-o3, DeepSeek-V3 y DeepSeek-R1.
- Los LLM se probaron en 50 casos de enfermedades críticas de la literatura publicada de la UCI.
- Se comparó la precisión del diagnóstico, la calidad del diagnóstico diferencial y la calidad de la respuesta.
Principales resultados:
- ChatGPT-o3 logró la mayor precisión de diagnóstico (72%), seguido por DeepSeek-R1 (68%) y ChatGPT-4o (64%). DeepSeek-V3 tiene una precisión del 32%.
- ChatGPT-o3, DeepSeek-R1 y ChatGPT-4o superaron significativamente el rendimiento de DeepSeek-V3.
- Todos los LLM evaluados demostraron una alta calidad de respuesta (completitud, claridad, utilidad), con ChatGPT-o3 y DeepSeek-R1 mostrando una calidad de diagnóstico diferencial superior.
Conclusiones:
- Los LLM recientemente desarrollados, en particular los modelos de razonamiento, muestran un potencial significativo para apoyar el diagnóstico en cuidados intensivos.
- El ajuste fino específico del dominio puede mejorar aún más la precisión del diagnóstico de LLM.
- El rendimiento competitivo de DeepSeek-R1 de código abierto destaca su potencial para entornos con recursos limitados.
Videos de Conceptos Relacionados
Classification of Illness
An illness is a response to a disease in which the person's level of functioning is changed compared with a previous level. The general classification of illness includes acute and chronic.
Acute illness is severe...
Language and Cognition
Improving Translational Accuracy

