Visual recognition limitations in multimodal large language models: A comparative analysis of histological image

Volodymyr Mavrych1, Einas M Yousef1, Ahmed Yaqinuddin1

  • 1College of Medicine, Alfaisal University, Riyadh, Kingdom of Saudi Arabia.

PLOS Digital Health
|March 19, 2026
PubMed
Summary

Gemini 2.5 Flash demonstrated superior histological image analysis compared to GPT-4o, Claude Sonnet 4, and Copilot. This study highlights current limitations in multimodal large language models' visual recognition for medical imaging.

Related Concept Videos