Beyond exam accuracy: Tracking a persistent-failure set reveals visual dental reasoning gaps in multimodal LLMs.

Yuichi Mine1, Tsuyoshi Taji2, Shota Okazaki3

  • 1Project Research Center for Integrating Digital Dentistry, Hiroshima University, 1-2-3 Kasumi Minami-ku, Hiroshima 734-8553, Japan; Department of Medical Systems Engineering, Graduate School of Biomedical and Health Sciences, Hiroshima University, 1-2-3 Kasumi Minami-ku, Hiroshima 734-8553, Japan.

Journal of Dentistry
|April 7, 2026
PubMed
Summary

General-purpose large language models (LLMs) show high accuracy on text-based dental exam questions but struggle with visual reasoning. Further evaluation is needed for reliable AI in dentistry.