Related Experiment Video
Updated: May 29, 2025

Author Spotlight: Evaluating Clinicians' Adoption of Ultrasound-Guided Vascular Cannulation Through Simulation Training
Published on: August 9, 2024
Unveiling GPT-4V's hidden challenges behind high accuracy on USMLE questions: Observational Study.
Zhichao Yang1, Zonghai Yao1, Mahbuba Tasmin1
1College of Information and Computer Science, University of Massachusetts Amherst, Amherst, MA, United States.
GPT-4 Vision (GPT-4V) shows high accuracy on medical image interpretation questions, but struggles with explanation quality and image understanding when incorrect. Further evaluation is needed before clinical integration.
Area of Science:
- Artificial Intelligence in Medicine
- Medical Image Analysis
- Large Language Models
Background:
- Recent AI advancements like GPT-4 show promise in text-based medical exams.
- The capability of AI models to interpret medical images remains largely unexplored.
- Evaluating AI in multimodal clinical scenarios is crucial for assessing readiness.
Purpose of the Study:
- To evaluate GPT-4 Vision (GPT-4V), GPT-4, and GPT-3.5 Turbo on image-based medical questions.
- To assess GPT-4V's performance, interpretability, and limitations in understanding clinical images.
- To identify potential flaws and readiness for clinical integration of multimodal AI.
Main Methods:
- A cross-sectional study using 227 multiple-choice questions with images from USMLE, DRQCE, and AMBOSS.
- Compared accuracy of GPT-4V against GPT-4 and GPT-3.5 Turbo.
- Evaluated explanation quality using human preference and qualitative metrics; simulated curbside consultations.
Main Results:
- GPT-4V achieved high accuracy (73.1%-88.9%) on image-based questions, outperforming GPT-4 and GPT-3.5 Turbo.
- Correct answers had expert-level explanations, but incorrect answers showed poor quality, including image misunderstandings.
- GPT-4V required specific prompts for complex cases and showed reduced error rates with expert assistance.
Conclusions:
- GPT-4V demonstrates significant potential for medical image interpretation assessments.
- Shortcomings in explanation quality and image interpretation for incorrect answers require attention.
- Comprehensive evaluations beyond multiple-choice questions are necessary before clinical deployment.
More Related Videos
08:523D Ultrasound Imaging: Fast and Cost-effective Morphometry of Musculoskeletal Tissue
Published on: November 27, 2017
10:38Observational Study Protocol for Repeated Clinical Examination and Critical Care Ultrasonography Within the Simple Intensive Care Studies
Published on: January 16, 2019
Related Concept Videos
Reliability and Validity
Ultrasonography
During an ultrasonography procedure, a handheld device called...
Sensitivity, Specificity, and Predicted Value
Sensitivity is the...