Video Experimental Relacionado
Updated: Jun 10, 2025

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
Pruebas y evaluación de las aplicaciones de los grandes modelos lingüísticos en el cuidado de la salud: una revisión
Suhana Bedi1, Yutong Liu2, Lucy Orr-Ewing2
1Department of Biomedical Data Science, Stanford School of Medicine, Stanford, California.
Las evaluaciones actuales de los grandes modelos de lenguaje (LLM) en la atención médica evalúan principalmente la precisión en los exámenes, descuidando los datos reales de los pacientes y aspectos críticos como la equidad. La investigación futura necesita un alcance más amplio y una relevancia clínica.
Área de la Ciencia:
- Inteligencia artificial en el cuidado de la salud
- Aplicaciones de procesamiento del lenguaje natural (NLP)
- La informática médica
Sus antecedentes:
- Los grandes modelos de lenguaje (LLM) muestran potencial para aplicaciones en el cuidado de la salud.
- Es posible que los métodos de evaluación existentes no reflejen completamente la utilidad de los LLM en entornos clínicos.
- Se necesita una comprensión completa de las evaluaciones actuales de LLM para orientar la investigación futura.
Objetivo del estudio:
- Revisar y clasificar sistemáticamente las evaluaciones existentes de los LLM en la atención sanitaria.
- Analizar las evaluaciones basadas en el tipo de datos, la tarea de atención médica, las tareas de PNL / NLU, las dimensiones de la evaluación y la especialidad médica.
- Identificar las lagunas y limitaciones en las estrategias actuales de evaluación de LLM en el ámbito médico.
Principales métodos:
- Búsqueda sistemática de literatura de PubMed y Web of Science (enero de 2022 - febrero de 2024).
- Inclusión de estudios que evalúen uno o más LLM en la atención sanitaria.
- Categorización de 519 estudios por revisores independientes en cinco componentes clave.
Principales resultados:
- Solo el 5% de los estudios utilizó datos reales de atención al paciente; la mayoría se centró en la evaluación del conocimiento médico (por ejemplo, exámenes de licencia) y el diagnóstico.
- La respuesta a las preguntas fue la tarea predominante de la PNL/NLU (84,2%), con un enfoque limitado en el resumen o el diálogo.
- La precisión fue la métrica de evaluación primaria (95,4%), mientras que la imparcialidad, el sesgo, la toxicidad y las consideraciones de despliegue se evaluaron con poca frecuencia.
Conclusiones:
- Las evaluaciones actuales de LLM en atención médica están fuertemente sesgadas hacia la precisión en las pruebas estandarizadas, carecen de datos clínicos del mundo real y consideraciones de tareas diversas.
- Los aspectos críticos como la equidad, el sesgo y la preparación para el despliegue están subestimados.
- La investigación futura debe priorizar las métricas estandarizadas, la utilización de datos clínicos y una gama más amplia de tareas y especialidades de atención médica para una evaluación sólida de LLM.
Más Videos Relacionados
Videos de Conceptos Relacionados
Issues And Trends In Healthcare Delivery System
Cost Containment
Payment for healthcare services has historically promoted adoption of costly and often unnecessary or inefficient...
Methods of Documentation VI: Case Management Model
For example, a patient with a chronic...
Health Information Technology and Healthcare Information System
Health Information Technology, commonly called HIT, integrates advanced information systems and technology in healthcare settings. Its primary functions include:
Documentation in Long-Term and Home Healthcare Setting
Long-Term Care Facilities
Statistical Software for Data Analysis and Clinical Trials
Purpose of Health Records I
Here's a breakdown of how health records serve these purposes:

