相关实验视频
Updated: Jul 19, 2025

08:08
Simulator Training for Endovascular Neurosurgery
Published on: May 6, 2020
3.7K
对神经外科的ChatGPT和GPT-4的表现 书面委员会考试
Rohaid Ali1, Oliver Y Tang1, Ian D Connolly2
1Department of Neurosurgery, The Warren Alpert Medical School of Brown University, Providence , Rhode Island , USA.
Neurosurgery
|August 15, 2023
概括
像ChatGPT和GPT-4这样的生成大型语言模型 (LLM) 在神经外科委员会考试中取得了合格分数. 与ChatGPT相比,GPT-4表现优越,这表明在专业医疗知识评估方面取得了进展.
科学领域:
- 人工智能在医学中的应用
- 自然语言处理自然语言处理.
- 医疗教育 技术 技术 医学教育
背景情况:
- 生成型大语言模型 (LLM) 在医疗应用中表现有前途.
- 之前的研究表明,一般的LLM几乎通过了医学考试.
- 高级LLM在专门的神经外科委员会考试中的表现并未得到充分理解.
研究的目的:
- 评估ChatGPT (GPT-3.5) 和GPT-4在模拟神经外科书面委员会考试中的表现.
- 确定影响专业医学评估LLM准确性的因素.
- 为了比较LLM的表现与人类考生.
主要方法:
- 使用了美国神经外科学会的自我评估考试1 (500个问题).
- 评估了ChatGPT (GPT-3.5) 和GPT-4在多选题上的表现.
- 采用统计分析 (奇平方,费舍尔精确,逻辑回归) 来检查基于问题特征的性能变化.
主要成果:
- 聊天GPT得分为73.4%,GPT-4得分为83.4%,两者都超过了69%的合格门.
- GPT-4显著超过了ChatGPT和平均用户 (P < .001).
- 诸如增加字数和高阶问题解决等因素对ChatGPT的准确性产生了负面影响,但对GPT-4的影响并没有.
结论:
- 聊天GPT和GPT-4都在严格的神经外科委员会考试中取得了合格分数.
- 与ChatGPT相比,GPT-4显示出了显著的性能改善.
- LLM显示了专门的医学知识评估的潜力,随着不断的进步.

