Video Experimental Relacionado
Updated: Jan 29, 2026

Involving Individuals with Developmental Language Disorder and Their Parents/Carers in Research Priority Setting
Published on: June 6, 2020
Evaluación de modelos de lenguaje grandes de razonamiento con pensamiento similar al humano en la respuesta a
Zhouqian Wang1, Chenjia Xu1, Lei Wang2
1Ningbo Key Laboratory of Medical Research on Blinding Eye Diseases, Ningbo Eye Institute, Ningbo Eye Hospital, Wenzhou Medical University, Ningbo, China.
Los modelos de lenguaje grandes de razonamiento (LLM) muestran un rendimiento mejorado en la respuesta a preguntas de oftalmología, destacando DeepSeek-R1. Estos modelos simulan mejor el pensamiento humano, allanando el camino para una IA más fiable en el cuidado de los ojos.
Área de la Ciencia:
- Inteligencia artificial en medicina
- Oftalmología
- Procesamiento del lenguaje natural
Sus antecedentes:
- Es crucial evaluar las capacidades de los modelos de lenguaje grandes (LLM) en dominios médicos especializados como la oftalmología.
- Evaluar los procesos de razonamiento, no solo la precisión, de los LLM es esencial para aplicaciones de IA fiables.
- Los LLM actuales pueden no replicar completamente el pensamiento matizado requerido para preguntas médicas complejas.
Objetivo del estudio:
- Evaluar el rendimiento de los modelos de lenguaje grandes de razonamiento (LLM) en la respuesta a preguntas relacionadas con la oftalmología.
- Comparar los LLM de razonamiento con los LLM convencionales sin razonamiento utilizando un marco de evaluación novedoso.
- Analizar la precisión y la calidad del razonamiento de los LLM en la respuesta a preguntas oftalmológicas.
Principales métodos:
- Se evaluaron dos LLM de razonamiento (DeepSeek-R1, QwQ-32B) y un LLM sin razonamiento (LLaMA-3.3-70B-Instruct).
- Se utilizó MedQA-Eye, un conjunto de datos personalizado de 967 preguntas de oftalmología en 10 subespecialidades y 3 idiomas.
- Se desarrolló un marco novedoso para evaluar los patrones de pensamiento de los LLM, simulando el razonamiento médico humano.
Principales resultados:
- DeepSeek-R1 logró la mayor precisión de respuesta (90,59%), superando a LLaMA-3.3-70B-Instruct (87,90%) y QwQ-32B (84,28%).
- La inferencia lógica incorrecta fue el principal modo de fallo para los LLM de razonamiento (93,41%-94,74% de los errores).
- DeepSeek-R1 demostró una incertidumbre semántica significativamente menor (1,04±3,63) en comparación con QwQ-32B (4,31±40,70), lo que indica un razonamiento más fiable.
Conclusiones:
- Los LLM de razonamiento, en particular DeepSeek-R1, muestran un rendimiento superior en la respuesta a preguntas oftalmológicas en comparación con los modelos sin razonamiento.
- Los hallazgos sugieren que los LLM de razonamiento pueden imitar mejor los procesos de pensamiento similares a los humanos en contextos médicos.
- Este avance promete el desarrollo de sistemas de IA más fiables y sofisticados en oftalmología.
Videos de Conceptos Relacionados
Reason and Intuition
Reasoning
Inductive reasoning involves deriving generalizations from specific observations. This type of reasoning helps form beliefs about the world. For example,...
Deductive Reasoning
For example, a researcher can deduce specific predictions...
Counterfactual Thinking
Language
Corballis and Suddendorf (2007) and Tomasello and Rakoczy (2003) highlight the role of language in...
Inductive Reasoning
Inductive reasoning is common in descriptive science. A life scientist makes observations and records them. This data can be qualitative or...

