检查聊天GPT 3.5和微软Copilot在耳鼻喉科的性能:与耳鼻喉科医生的评估进行比较研究
Miguel Mayo-Yáñez1,2,3,4, Jerome R Lechien1,5,6,7,8, Alberto Maria-Saibene1,9
1Young-Otolaryngologists of the International Federation of Oto-Rhino-Laryngological Societies (YO-IFOS) Study Group, 75000 Paris, France.
概括
微软Copilot (GPT-4) 在耳鼻喉科考试中明显超过了ChatGPT 3.5,在专家中获得第二高的分数. 这突出了GPT-4的重点.
科学领域:
- 医学教育 医学教育
- 医疗保健中的人工智能
- 耳鼻喉科 耳鼻喉科 耳鼻喉科
背景情况:
- 在医学评估中评估人工智能 (AI) 的能力对于理解它们在医疗保健中的潜在作用至关重要.
- 像ChatGPT和GPT-4这样的大型语言模型 (LLM) 越来越多地被测试,以确定它们的医学知识和响应准确性.
研究的目的:
- 在耳鼻喉科检查中,将ChatGPT 3.5和连接互联网的GPT-4 (Microsoft Copilot) 与人类专家的性能进行比较.
- 在高风险的医疗职位竞争中评估AI反应的准确性和排名.
主要方法:
- 一个135个问题的耳鼻喉科考试 (理论和实践) 被管理到ChatGPT 3.5和微软Copilot.
- 人工智能反应与108名耳鼻喉科专家的官方评分进行了比较.
- 使用Stata 14.2进行统计分析,以评估性能差异.
主要成果:
- 微软Copilot (GPT-4) 的得分为88.5%,明显优于ChatGPT 3.5的得分为60%.
- 在所有参与者中,Copilot的表现排名第二,而ChatGPT排名第83位.
- 在两种AI模型提供的不正确答案中都发现了差异.
结论:
- 与互联网连接的GPT-4 (微软Copilot) 与ChatGPT 3.5.5相比,在回答耳鼻喉科多选题方面表现优越.
- 先进的AI模型显示出在专门的医学知识评估中具有高性能潜力.
- 需要进一步的研究来探索AI性能的细微差别和医学问题答案中的潜在偏见.


