Video Experimental Relacionado
Updated: Feb 28, 2026

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
Evaluación de modelos de lenguaje grandes como predictores de revisitas al departamento de emergencias
Emma Chen1, Luyang Luo2, Fatma Gunturkun3
1Department of Biomedical Informatics, Harvard Medical School, Boston, MA, USA2Harvard John A. Paulson School Of Engineering And Applied Sciences, Cambridge, MA, USA, yingchen@g.harvard.edu.
Los modelos de lenguaje grandes (LLM) muestran potencial en la predicción clínica pero tienen dificultades con las tareas del mundo real de revisitas al departamento de emergencias (DE). Los LLM actuales, incluso con métodos avanzados, no superan a los modelos tradicionales, lo que resalta las limitaciones en la predicción clínica.
Área de la Ciencia:
- Inteligencia artificial en medicina
- Informática clínica
- Aprendizaje automático para la atención médica
Sus antecedentes:
- Los modelos de lenguaje grandes (LLM) demuestran capacidades en el razonamiento clínico y la respuesta a preguntas.
- La eficacia de los LLM para tareas de predicción clínica en el mundo real, como la predicción de resultados de pacientes, sigue siendo en gran medida inexplorada.
- La predicción de revisitas al departamento de emergencias (DE) es crucial para optimizar la atención al paciente y la asignación de recursos.
Objetivo del estudio:
- Evaluar el rendimiento de los modelos de lenguaje grandes (LLM) en la predicción de revisitas al departamento de emergencias (DE) a los 30 días.
- Comparar diferentes paradigmas de modelado de LLM, incluyendo predicción directa y enfoques basados en incrustaciones.
- Comparar el rendimiento de los LLM con modelos de aprendizaje automático tradicionales utilizando datos clínicos completos.
Principales métodos:
- Un estudio a gran escala que involucra 138010 visitas de adultos al DE de Stanford.
- Se evaluaron dos enfoques de LLM: predicción directa con salida de lenguaje natural y métodos basados en incrustaciones (LLM2Vec).
- Se aplicó aumento de recuperación a la predicción directa; se utilizaron incrustaciones derivadas de LLM para modelado posterior.
- Se utilizaron incrustaciones derivadas de LLM para modelado posterior.
Principales resultados:
- Los enfoques de LLM basados en incrustaciones (LLM2Vec F1=0.4505) superaron a los métodos de predicción directa (Claude 3.7 F1=0.4160 con aumento de recuperación).
- A pesar del acceso a datos extensos, todos los enfoques de LLM (F1=0.3022-0.4505) tuvieron un rendimiento inferior al de un modelo tradicional LightGBM (F1=0.4614) que utiliza solo datos estructurados.
- El análisis de 17488 predicciones sugirió que los fallos de razonamiento de los LLM incluyen la sobrevaloración del historial, la negligencia de los factores protectores y la aversión al riesgo.
Conclusiones:
- Los LLM de generación actual exhiben limitaciones fundamentales para tareas de predicción clínica como la predicción de revisitas al DE.
- Los métodos de LLM basados en incrustaciones muestran promesa pero aún no superan a los modelos tradicionales.
- Se necesita más investigación para abordar los fallos sistemáticos de razonamiento en los LLM para aplicaciones clínicas.

