Video Experimental Relacionado
Updated: Feb 7, 2026

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
Evaluación comparativa de modelos de lenguaje de visión de código abierto en exámenes de formación en ortopedia: una
Sunho Ko1, Jaewook Lee2, Kyunga Ko3
1Department of Orthopedic Surgery, Seoul National University Hospital, Seoul, Korea.
Los modelos de lenguaje de visión (VLM) de código abierto muestran potencial en la atención ortopédica, y los modelos grandes igualan el rendimiento de los residentes. Sin embargo, los modelos más pequeños y las subespecialidades específicas como columna y pediatría requieren un mayor desarrollo.
Área de la Ciencia:
- Inteligencia artificial en medicina
- Análisis de imágenes médicas
- Educación en cirugía ortopédica
Sus antecedentes:
- El avance de la atención ortopédica requiere IA multimodal, incluido el procesamiento de imágenes y la implementación segura.
- La literatura actual explora poco los VLM de código abierto para estas aplicaciones.
- Las operaciones internas seguras y las capacidades multimodales son fundamentales para la integración de la IA en la ortopedia.
Objetivo del estudio:
- Evaluar los VLM de código abierto frente a los residentes de ortopedia utilizando el Examen de Formación en Ortopedia (OITE).
- Evaluar el rendimiento de los VLM en las subespecialidades ortopédicas.
- Investigar la relación entre el tamaño del parámetro del VLM y el rendimiento.
Principales métodos:
- Se evaluaron seis VLM de código abierto de diferentes tamaños utilizando el OITE 2023 (210 preguntas, 111 con imágenes).
- Se comparó el rendimiento del modelo con las puntuaciones de los residentes del OITE 2023.
- Se utilizó la correlación de Pearson para analizar la asociación entre el tamaño del modelo y el rendimiento.
Principales resultados:
- Los VLM más grandes (Qwen2.5-VL-72B, Llama-3.2-90B) tuvieron un rendimiento comparable al de los residentes de segundo año.
- Un modelo de tamaño mediano (Qwen-32B) superó a los residentes de primer año; los modelos más pequeños tuvieron un rendimiento inferior al de los residentes de primer año.
- Qwen2.5-VL-72B se destacó en medicina de pie/tobillo y deportiva; Llama-3.2-90B lideró en ciencias básicas y mano/muñeca.
- Todos los modelos tuvieron dificultades con las preguntas de columna y pediátricas; la precisión aumentó con el tamaño hasta 72 mil millones de parámetros.
Conclusiones:
- Los VLM más pequeños ofrecen menores necesidades de hardware pero menor precisión.
- Los dominios de columna y pediátricos siguen siendo un desafío para los VLM actuales.
- La selección del modelo requiere equilibrar las necesidades clínicas con las limitaciones de hardware basándose en puntos de referencia específicos del dominio.
- Los VLM de código abierto muestran potencial pero necesitan un mayor refinamiento para uso clínico y educativo.
Videos de Conceptos Relacionados
Sources of Self-Esteem III: Social Comparison
Language
Corballis and Suddendorf (2007) and Tomasello and Rakoczy (2003) highlight the role of language in...
Vision
Conservation of Protein Domains Over Different Proteins
A limited set of protein domains often duplicate and recombine during evolution. These domains can be organized in different combinations to...
The Sense of Self: Reflected Self-Appraisal and Social Comparison
Pharmacokinetic Models: Comparison and Selection Criterion
Physiological models take a detailed approach by considering specific molecular processes. They can predict drug distribution, metabolism, and elimination changes, providing a comprehensive understanding of how drugs interact with the body.

