评估ChatGPT在神经学书面委员会考试问题上的表现
Tse Chian Chen1, Evan Multala2, Patrick Kearns2
1Neurology, Tulane University School of Medicine, New Orleans, Louisiana, USA.
BMJ neurology open
|November 8, 2023
概括
像ChatGPT这样的人工智能 (AI) 在医疗保健教育中显示出潜力,在考试问题上表现类似于人类神经学居民. 通过多次尝试,它的准确性得到了提高,这表明它在医学学习中发挥了有前途的作用.
科学领域:
- 医学教育 医学教育
- 医疗保健中的人工智能
- 神经学 神经学
背景情况:
- 聊天GPT展示了医疗保健领域的新兴能力.
- 评估新的AI工具对于推进医学教育至关重要.
研究的目的:
- 评估ChatGPT在回答神经病学委员会考试问题的表现.
- 将AI性能与人类学习者基准进行比较.
主要方法:
- 使用了509个神经学板式问题从BoardVitals,不包括基于图像的项目.
- 提供了ChatGPT的问题和多选答案,允许多达三次尝试.
- 将人工智能生成的答案与人类用户数据进行比较.
主要成果:
- 在第一次尝试时,ChatGPT的准确率达到了65.8%,在三次尝试中达到75.3%.
- 绩效分别相当于第26和第50个百分点,与神经病学住院医生相比较.
- 具体对象的表现各不相同,在疼痛方面得分高,在成像方面得分低.
结论:
- 聊天GPT在神经学委员会问题上的表现与人类学习者相当.
- 人工智能准确性随着代尝试而提高,这表明了医学知识评估的潜力.
- 需要进一步的研究来确定人工智能的整合到临床决策和医学教育中.
关键词:
临床神经学 临床神经学

