聊天GPT 3.5和GPT4关于鼻科标准化委员会考试问题的比较表现
Evan A Patel1, Lindsay Fleischer1, Peter Filip1
1Department of Otorhinolaryngology-Head and Neck Surgery Rush University Medical Center Chicago Illinois USA.
OTO open
|June 28, 2024
概括
像ChatGPT 3.5和GPT4这样的大型语言模型 (LLM) 在耳鼻喉科委员会考试问题上进行了测试. GPT4的表现明显优于ChatGPT 3.5,这表明AI在医学教育中的潜力越来越大.
科学领域:
- 人工智能在医学中的应用
- 深度学习应用程序
- 医疗教育 技术 技术 医学教育
背景情况:
- 由于人工智能 (AI) 的进步,ChatGPT等大型语言模型 (LLM) 已经出现.
- 在专门的医学检查中评估这些AI模型的性能对于理解它们的潜在应用至关重要.
研究的目的:
- 评估聊天GPT 3.5和GPT4关于耳鼻喉科 (鼻科) 标准化委员会考试问题的表现.
- 将AI性能与耳鼻喉科住院医生的结果进行比较.
主要方法:
- 使用了 BoardVitals 的 127 个鼻科标准化问题.
- 聊天GPT 3.5和GPT4回答了93个基于文本的问题;GPT4还回答了34个基于图像的问题.
- 绩效与居民绩效进行了比较,在第10个百分点的合格-失败截止值.
主要成果:
- 在文本问题上,ChatGPT 3.5实现了45.2%的准确率 (第8个百分比),可能会在考试中失败.
- 在文本问题上,GPT4的准确率达到86.0%,在图像问题上达到64.7%,这表明通过的机会很大.
- 对于两种模型的表现都发现了统计学意义 (P=3.5的.0001,P=4.001的4).
结论:
- 聊天GPT 3.5不太可能通过美国耳鼻喉科委员会书面问题考试 (ABOto WQE).
- 在GPT4中,通过ABO到WQE的可能性显著更高.
- 人工智能的快速发展表明,人工智能未来可能在耳鼻喉学教育和实践中发挥作用.


