Vision-Language Model for Visual Question Answering in Medical Imagery

Yakoub Bazi1, Mohamad Mahmoud Al Rahhal2, Laila Bashmal1

  • 1Computer Engineering Department, College of Computer and Information Sciences, King Saud University, Riyadh 11543, Saudi Arabia.

Summary

This study introduces a novel transformer-based approach for medical visual question answering (VQA) systems. The model shows promising results on radiology image datasets, advancing diagnostic capabilities.