Video Experimental Relacionado
Updated: Sep 9, 2025

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
De los algoritmos a la sala de operaciones: ¿pueden los grandes modelos de lenguaje dominar el examen de
Qiyu He1, Zhimin Tan2, Wang Niu2
1Department of Urology and Andrology Laboratory, West China Hospital, Sichuan University, Chengdu, Sichuan Province, China.
Los modelos de lenguaje grande (LLM) muestran potencial en el razonamiento clínico, pero corren el riesgo de errores críticos. DeepSeek-R1 y GPT-4 superaron a otros, aunque todos lucharon con escenarios complejos, destacando la necesidad de una evaluación cuidadosa en entornos médicos de alto riesgo.
Área de la Ciencia:
- La inteligencia artificial en la medicina
- Sistemas de apoyo a la toma de decisiones clínicas
- Tecnología de la educación médica
Sus antecedentes:
- El rendimiento de los grandes modelos de lenguaje (LLM) en el razonamiento clínico complejo sigue siendo en gran medida no establecido.
- La evaluación de los LLM en evaluaciones médicas estandarizadas es crucial para comprender sus capacidades y limitaciones.
- Se necesitan puntos de referencia de IA para guiar la integración de los LLM en la educación y la práctica médicas.
Objetivo del estudio:
- Para comparar el rendimiento de los principales LLM (ChatGPT y DeepSeek) en un examen médico de anestesiología desafiante.
- Establecer puntos de referencia de IA para tareas complejas de razonamiento clínico dentro de las evaluaciones médicas.
- Informar el desarrollo de herramientas basadas en la IA para la educación médica y el apoyo a la toma de decisiones clínicas.
Principales métodos:
- Evaluación transversal de cuatro iteraciones de LLM (GPT-3.5, GPT-4, DeepSeek-V3, DeepSeek-R1) utilizando el banco de preguntas del examen médico asistente de anestesiología china (CAAPE) de 2025 (5,647 preguntas).
- Se emplearon diversas estrategias y lenguajes de consulta, con análisis de subgrupos centrados en la subespecialidad, el tipo de conocimiento y el formato de las preguntas.
- Las métricas de rendimiento incluían precisión, tipos de error y tiempos de respuesta, con un enfoque específico en las capacidades de razonamiento clínico y lógico.
Principales resultados:
- DeepSeek-R1 (70,6% -73,4%) y GPT-4 (68,6% -70,3%) demostraron un rendimiento superior al de DeepSeek-V3 (53,1% -55,5%) y el de GPT-3.5 (52,2% -55,7%).
- El papel del sistema que provocaba un rendimiento mejorado, mientras que las estrategias de respuesta conjuntas eran perjudiciales; DeepSeek-R1 logró una precisión máxima (73,4%) en condiciones específicas de activación.
- Todos los modelos sobresalieron en conocimientos básicos, pero fallaron en escenarios clínicos complejos y razonamiento avanzado, con más del 70% de los errores siendo lógicos/informativos y muchos de alto riesgo.
Conclusiones:
- Los LLM son prometedores para el razonamiento clínico complejo, pero conllevan un riesgo significativo de errores críticos en escenarios médicos de alto riesgo.
- Si bien es valioso para la educación médica y el apoyo a la toma de decisiones, el potencial de error de los LLM requiere una evaluación rigurosa antes de su implementación en entornos clínicos críticos.
- Se requiere más investigación para mitigar las tasas de error de los LLM y mejorar su fiabilidad para un uso seguro y efectivo en la atención médica.
Más Videos Relacionados
Videos de Conceptos Relacionados
Cardiopulmonary Resuscitation II: ACLS Airway Management
Assessment of Airway, Skin Color, and Use of Accessory Muscles
Introduction
The initial evaluation of a patient's respiratory system...

