Four general-purpose large language models (ChatGPT-5, Claude 4, Grok 4 and Gemini 2.5) show comparable performance

Oriol Pujol1,2, Robert Ferrer3, Alex Coelho4

  • 1Knee Surgery Unit, Orthopaedic Surgery Department, Vall d'Hebron University Hospital, Universitat Autònoma de Barcelona (Departament de Cirurgia), Barcelona, Spain.

Abstract

Related Concept Videos