Evaluación de la precisión diagnóstica y el razonamiento clínico de múltiples modelos de lenguaje grandes en

Resumen

La evaluación de los modelos de lenguaje grandes (LLM) para el diagnóstico psiquiátrico requiere la evaluación de la calidad del razonamiento, no solo de la precisión. Las calificaciones de los clínicos sobre los rastros de razonamiento de los LLM se correlacionan fuertemente con la corrección diagnóstica, lo que resalta la necesidad de evaluaciones centradas en el razonamiento.