Cross-Modal self-supervised vision language pre-training with multiple objectives for medical visual question

Gang Liu1, Jinlong He1, Pengfei Li1

  • 1College of Computer Science and Technology, Harbin Engineering University, Harbin, 150001, Heilongjiang, China.

PubMed
Summary

This study introduces Cross-Modal pre-training with Multiple Objectives (CMMO) for medical visual question answering (VQA). CMMO significantly improves VQA performance by aligning medical image features with textual concepts, outperforming existing methods on multiple datasets.