De los algoritmos a la sala de operaciones: ¿pueden los grandes modelos de lenguaje dominar el examen de

Qiyu He1, Zhimin Tan2, Wang Niu2

  • 1Department of Urology and Andrology Laboratory, West China Hospital, Sichuan University, Chengdu, Sichuan Province, China.

Resumen

Los modelos de lenguaje grande (LLM) muestran potencial en el razonamiento clínico, pero corren el riesgo de errores críticos. DeepSeek-R1 y GPT-4 superaron a otros, aunque todos lucharon con escenarios complejos, destacando la necesidad de una evaluación cuidadosa en entornos médicos de alto riesgo.