Video Experimental Relacionado
Updated: Jan 8, 2026

Author Spotlight: Improving Radiation Therapy Access with Radiation Planning Assistant
Published on: October 6, 2023
ChatGPT frente a DeepSeek: Evaluación del rendimiento de la inteligencia artificial en preguntas de examen de
Ronald Chow1,2,3, Ajay Zheng1, Chenxi Gao1
1Department of Radiation Oncology, New York Proton Center, New York, New York.
DeepSeek-R1, un nuevo modelo de lenguaje grande, muestra menor precisión y tiempos de respuesta más lentos que ChatGPT para preguntas médicas. A pesar de ser más rentable, su precisión médica requiere una evaluación cuidadosa antes de su uso clínico.
Área de la Ciencia:
- Inteligencia Artificial en Medicina
- Procesamiento del Lenguaje Natural
- Tecnología Educativa Médica
Sus antecedentes:
- Los modelos de lenguaje grandes (LLM) se evalúan cada vez más para la capacidad de respuesta a preguntas médicas.
- El rendimiento del recién lanzado modelo DeepSeek en el dominio médico aún no se ha evaluado.
- Este estudio marca la primera evaluación de la precisión de DeepSeek para consultas médicas.
Objetivo del estudio:
- Evaluar la precisión médica del modelo de lenguaje grande DeepSeek-R1.
- Comparar el rendimiento de DeepSeek-R1 con ChatGPT en preguntas de examen de oncología radioterápica.
- Evaluar el tiempo de respuesta, el uso de tokens y la rentabilidad de ambos LLM.
Principales métodos:
- Se utilizaron 600 preguntas de opción múltiple de oncología radioterápica para probar DeepSeek-R1 y ChatGPT.
- Se registraron la precisión, los tokens de entrada/salida y el tiempo de ejecución para cada modelo.
- Se analizó el rendimiento en diferentes categorías de preguntas, con una tasa de error de Tipo I de 0,05.
Principales resultados:
- DeepSeek-R1 logró una precisión del 84,0% (59 s/pregunta), con un rendimiento inferior en estudios de referencia (74,2%).
- ChatGPT o1 logró una precisión del 89,0% (10 s/pregunta), con alta precisión en estudios de referencia (93,5%).
- DeepSeek-R1 fue más costoso por token pero significativamente más barato en general (1,56 $ frente a 37,96 $ a precios de febrero de 2025).
Conclusiones:
- DeepSeek-R1 es menos preciso y más lento que ChatGPT o1, pero sustancialmente más rentable.
- La elección entre modelos requiere equilibrar los objetivos de precisión y eficiencia con las consideraciones financieras.
- Se necesita un análisis adicional para determinar la implementación óptima de estos LLM en contextos médicos.
Más Videos Relacionados
07:57Positron Emission Tomography-based Dose Painting Radiation Therapy in a Glioblastoma Rat Model using the Small Animal Radiation Research Platform
Published on: March 24, 2022
08:05Detection and Isolation of Cancer in Prostate Biopsies Using Stimulated Raman Histology and Artificial Intelligence
Published on: June 10, 2025