Merlin: A Vision Language Foundation Model for 3D Computed Tomography

Louis Blankemeier1,2,3, Joseph Paul Cohen2, Ashwin Kumar2,3

  • 1Department of Electrical Engineering, Stanford University.

Research Square
|July 9, 2024
PubMed
Summary

Merlin, a novel 3D vision-language model (VLM), interprets abdominal CT scans using EHR data and reports. This AI tool enhances medical image analysis and disease prediction, trained efficiently on a single GPU.