Video Experimental Relacionado
Updated: Feb 14, 2026

Evaluation of Commercial-Off-The-Shelf Wrist Wearables to Estimate Stress on Students
Published on: June 16, 2018
Estimación de la edad ósea a partir de radiografías de mano-muñeca asistida por atlas utilizando modelos grandes de
1Department of Radiology, Kastamonu Training and Research Hospital, Kastamonu 37150, Turkey.
ChatGPT-5 demostró el mejor rendimiento entre cuatro modelos grandes de lenguaje multimodales (LLM) en la evaluación de la edad ósea, mostrando utilidad clínica. Otros modelos como Gemini 2.5 Pro, Grok-3 y Claude 4 Sonnet mostraron una fiabilidad insuficiente para la determinación de la edad ósea.
Área de la Ciencia:
- Imágenes Médicas; Inteligencia Artificial en Medicina; Endocrinología Pediátrica
Sus antecedentes:
- La evaluación de la edad ósea es crucial en endocrinología pediátrica y medicina forense.; Los modelos grandes de lenguaje multimodales (LLM) muestran promesa en imágenes médicas, pero requieren evaluación para la determinación de la edad ósea.; El atlas Gilsanz-Ratib (GR) es una referencia estándar para la evaluación de la edad ósea.
Objetivo del estudio:
- Evaluar el rendimiento diagnóstico de cuatro LLM multimodales (ChatGPT-5, Gemini 2.5 Pro, Grok-3, Claude 4 Sonnet) en la determinación de la edad ósea.; Comparar el rendimiento de los LLM con la evaluación de un radiólogo utilizando el atlas GR.; Determinar la utilidad clínica de estos LLM para la evaluación de la edad ósea.
Principales métodos:
- Análisis retrospectivo de 245 radiografías pediátricas de muñeca (edad < 18).; Se utilizaron LLM con indicaciones asistidas por el atlas GR para la estimación de la edad ósea.; Las métricas de rendimiento incluyeron el Error Absoluto Medio (MAE), el Coeficiente de Correlación Intraclase (ICC) y el análisis de Bland-Altman.; Comparación con la evaluación basada en el atlas GR de un radiólogo experimentado.
Principales resultados:
- ChatGPT-5 logró el MAE más bajo (1,46 años) y el ICC más alto (0,849), demostrando un rendimiento superior.; Gemini 2.5 Pro mostró un rendimiento moderado (MAE: 2,24 años).; Grok-3 (MAE: 3,14 años) y Claude 4 Sonnet (MAE: 4,29 años) exhibieron tasas de error demasiado altas para la aplicación clínica.
Conclusiones:
- Existen variaciones significativas en el rendimiento entre los LLM multimodales para la evaluación de la edad ósea.; Solo ChatGPT-5 cumplió los criterios de utilidad clínica, lo que sugiere su potencial como herramienta auxiliar o para apoyo educativo bajo supervisión.; Los LLM multimodales actuales, excluyendo ChatGPT-5, carecen de la fiabilidad para la determinación clínica de la edad ósea.
Más Videos Relacionados
07:22Glycemic Impact on Knee Osteoarthritis Symptoms on Physical, Radiographic, and Inflammatory Markers among Individuals Aged 50 and Over with Diabetes
Published on: March 7, 2025
04:10Author Spotlight: Expanding Interventional Pulmonology Research with Robotic-Assisted Bronchoscopy
Published on: July 19, 2024
Videos de Conceptos Relacionados
Language
Corballis and Suddendorf (2007) and Tomasello and Rakoczy (2003) highlight the role of language in...
Components of Language
Language Development
The critical period for language acquisition suggests that the ability to acquire language is at its peak early in life. As people age, this proficiency decreases. Language development begins very...
Language and Cognition
Hand hygiene
Hand washing...
What are Estimates?
The estimate for the mean of a sample is denoted by ͞x, whereas the mean of the population is designated as μ. Further, parameters such...