Assessment of frontier Large Language Models in sleep medicine

Anshum Patel1, Het Contractor1, Hayden Heninger1

  • 1Division of Pulmonary, Allergy and Sleep Medicine, Mayo Clinic, Jacksonville, FL, United States.

Summary

Frontier large language models (LLMs) like ChatGPT-5 and Grok-4 excel at sleep medicine knowledge recall but struggle with complex differential diagnosis generation. Performance was similar between models, indicating current LLMs are better for focused support than broad hypothesis generation.

Related Concept Videos