Video Experimental Relacionado
Updated: May 8, 2026

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
Evaluación de grandes modelos de lenguaje en neuro-oncología: un estudio comparativo de la precisión, la integridad y
Shefqet Hajdari1, Minaam Farooq2, Aleeza Habib2
1University Hospital Bonn, Department of Neurosurgery, Bonn, Germany.
ChatGPT-4 demostró un rendimiento superior en precisión, integridad y utilidad para casos de neuro-oncología en comparación con Gemini Advanced y ChatGPT-3.5. Se recomienda una mayor investigación para explorar los grandes modelos de lenguaje (LLM) en la práctica clínica.
Área de la Ciencia:
- La inteligencia artificial en la medicina
- Sistemas de apoyo a la toma de decisiones clínicas
- Investigación en neuro-oncología
Sus antecedentes:
- Los modelos de lenguaje grande (LLM) se exploran cada vez más para aplicaciones de atención médica debido a sus capacidades de procesamiento de datos.
- La evaluación de la utilidad clínica de los LLM en campos especializados como la neuro-oncología es crucial.
- El desempeño actual de LLM en dominios médicos complejos requiere una evaluación rigurosa.
Objetivo del estudio:
- Para comparar la precisión, la integridad y la utilidad de las respuestas de Gemini Advanced, ChatGPT-3.5, y ChatGPT-4 en neuro-oncología.
- Evaluar el rendimiento del LLM en varios aspectos de la gestión de casos de neurooncología.
- Identificar el LLM más eficaz para el apoyo a la decisión clínica en neuro-oncología.
Principales métodos:
- Se utilizaron veinte casos comunes de neuro-oncología para el estudio.
- Se plantearon cuatro preguntas estandarizadas (diagnóstico diferencial, análisis, diagnóstico provisional, gestión) a cada LLM.
- Las respuestas fueron evaluadas por neuro-oncólogos de alto nivel utilizando escalas de precisión, integridad y utilidad, con análisis estadístico (ANOVA, prueba de Dunn) aplicado.
Principales resultados:
- ChatGPT-4 exhibió las puntuaciones más altas en precisión (x̅=5.12), integridad (x̅=2.05) y utilidad (x̅=2.06).
- Gemini Advanced mostró un rendimiento comparable, seguido por ChatGPT-3.5.
- Se observaron diferencias estadísticamente significativas en la exhaustividad del diagnóstico diferencial y en la exhaustividad general entre los LLM.
Conclusiones:
- ChatGPT-4 parece ser el LLM más competente para la evaluación de casos de neurooncología entre los evaluados.
- Se necesitan estudios más extensos con más neurocirujanos y casos diversos para comprender completamente las capacidades de LLM.
- La investigación futura podría investigar la generación aumentada de recuperación (RAG) con capacitación especializada en neuro-oncología.
Más Videos Relacionados
Videos de Conceptos Relacionados
Higher Mental Functions of the Brain: Language
Language formation and comprehension take place in the dominant hemisphere. The dominant hemisphere is responsible for understanding the meaning of spoken, written, or sign language, as well as the ability to communicate. For most people, the left hemisphere is the dominant one. The right hemisphere, then, gives tone and emotional context to the...
Aneurysm II: Clinical Manifestations and Diagnostic Studies

