Video Experimental Relacionado
Updated: Feb 24, 2026

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
Evaluación de la precisión diagnóstica y el razonamiento clínico de múltiples modelos de lenguaje grandes en
La evaluación de los modelos de lenguaje grandes (LLM) para el diagnóstico psiquiátrico requiere la evaluación de la calidad del razonamiento, no solo de la precisión. Las calificaciones de los clínicos sobre los rastros de razonamiento de los LLM se correlacionan fuertemente con la corrección diagnóstica, lo que resalta la necesidad de evaluaciones centradas en el razonamiento.
Área de la Ciencia:
- Inteligencia artificial en medicina
- Sistemas de apoyo a la toma de decisiones clínicas
- Diagnóstico psiquiátrico
Sus antecedentes:
- Las evaluaciones actuales de los modelos de lenguaje grandes (LLM) utilizan principalmente puntos de referencia de precisión, que evalúan de manera inadecuada las capacidades de razonamiento diagnóstico.
- Los estudios existentes a menudo analizan explicaciones post hoc en lugar de artefactos de razonamiento distintos y visibles para el clínico, lo que crea una brecha de traducción para dominios de diagnóstico complejos como la psiquiatría.
- El diagnóstico psiquiátrico se basa en gran medida en la interpretación narrativa, el razonamiento matizado y el manejo de la incertidumbre, áreas donde las métricas de precisión por sí solas son insuficientes.
Objetivo del estudio:
- Evaluar la precisión diagnóstica y la calidad del razonamiento clínico de los LLM de última generación en psiquiatría utilizando un conjunto de datos curado por clínicos.
- Investigar la asociación entre la calidad del razonamiento evaluada por el clínico y la corrección diagnóstica, comparando el rendimiento de los LLM con el de los residentes de psiquiatría.
- Determinar si la calidad del razonamiento proporciona una medida más significativa del rendimiento de los LLM que la precisión de la extracción de datos por sí sola.
Principales métodos:
- Una evaluación de métodos mixtos de cuatro LLM utilizando 196 viñetas de casos psiquiátricos (135 publicados, 61 nuevos).
- Precisión diagnóstica evaluada a través de múltiples métricas (precisión top-1, top-5, recall@5, MRR) en diagnósticos diferenciales clasificados.
- Calidad del razonamiento clínico evaluada en 30 viñetas por clínicos que evaluaron rastros de razonamiento generados por el modelo y comentarios cualitativos.
Principales resultados:
- La calidad del razonamiento diagnóstico calificada por el clínico mostró una fuerte asociación con la corrección diagnóstica (β = 1·80; p < 0·001), a diferencia de la calidad de la extracción de datos.
- Los LLM demostraron una precisión diagnóstica de moderada a alta, y el modelo superior logró una precisión top-5 de 0·801 y las puntuaciones de razonamiento más altas.
- La precisión diagnóstica de los LLM fue comparable a la de los residentes de psiquiatría en una comparación ilustrativa.
Conclusiones:
- La calidad del razonamiento diagnóstico calificada por el clínico captura variaciones clínicamente significativas en el rendimiento de los LLM más allá de la simple precisión.
- La psiquiatría sirve como un campo de pruebas riguroso para evaluar el razonamiento de los LLM en entornos clínicos intensivos en narrativa.
- Las futuras evaluaciones de soporte de decisiones clínicas de LLM deben integrar evaluaciones estructuradas de los procesos de razonamiento, no solo métricas de precisión.
Más Videos Relacionados
07:31Implementation of a Real-Time Psychosis Risk Detection and Alerting System Based on Electronic Health Records using CogStack
Published on: May 15, 2020
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
Videos de Conceptos Relacionados
Language and Cognition
Diagnostic and Statistical Manual of Mental Disorders (DSM)