Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models

Summary

Medical vision-language models (med-VLMs) improve diagnostic accuracy by aligning medical images and reports. MedTrim enhances this alignment by focusing on fine-grained pathology details, leading to better performance in downstream tasks.

Related Concept Videos