Performance Evaluation of Large Language Models in Multilingual Medical Multiple-Choice Questions: Mixed Methods

Livia Maria Strasser1, Wilma Anschuetz2, Fabio Dennstädt1,3

  • 1Medical Knowledge and Decision Support, School of Medicine, University of St.Gallen, St.Jakobstrasse 21, St.Gallen, 9000, Switzerland, +41 71 224 32 00.

JMIR Medical Education
|March 11, 2026
PubMed
Summary

Large language models (LLMs) show varied accuracy on medical questions across languages, with German performing best. Prompting in English generally improved results, but human oversight is crucial for reliable integration into medical education.

Related Concept Videos