在双语委员会考试中,神经外科专用,同行评审和通用AI聊天机器人的比较性能:评估准确性,一致性和减少错误的策略
Mahmut Çamlar1, Umut Tan Sevgi2, Gökberk Erol3
1Department of Neurosurgery, Izmir City Hospital, University of Health Sciences, Şevket İnce Neighborhood, 2148/11 Street, No:1/11, 35540, Bayraklı, İzmir, Turkey. drcamlar@gmail.com.
Acta neurochirurgica
|September 9, 2025
概括
大型语言模型 (LLM) 在神经外科培训中表现有前途,在多选题中表现良好,但在基于图像的评估中扎. 基于GPT-4的模型和AtlasGPT为特定问题类型提供了近乎专家的能力,尽管它们是补充工具.
科学领域:
- 人工智能在医学中的应用
- 神经外科教育技术 神经外科教育技术
- 大型语言模型的性能评估.
背景情况:
- 大型语言模型 (LLM) 越来越多地被探索为医疗学员的教育辅助工具.
- 之前的研究表明,对于多选题,LLM的知识和一致性是可以接受的,但在案例讨论和解释方面存在局限性.
- 强调了对神经外科LLM的专业评估的需要.
研究的目的:
- 评估六个不同的LLM在回答土耳其语和英语神经外科多项选择题方面的表现.
- 评估这些LLM在专业医疗领域的准确性和一致性.
主要方法:
- 六个LLM (ChatGPT-o1pro,ChatGPT-4,AtlasGPT,Gemini,Copilot,ChatGPT-3.5) 在599个神经外科多选题中进行了测试.
- 问题来源于土耳其委员会考试和英国神经外科问题库.
- 使用比例z测试比较正确率,并使用科恩的kappa分析模型间的一致性.
主要成果:
- 基于GPT-4的模型 (ChatGPT-o1pro,ChatGPT-4) 和AtlasGPT在单个最佳答案回忆 (SBA-R),单个最佳答案解释应用 (SBA-I) 和真假问题格式方面取得了高准确性.
- 当面对涉及图像的问题时,模型的性能显著下降.
- 一些LLM未能回答大量基于图像的问题.
结论:
- 基于GPT-4的模型和AtlasGPT在特定的神经外科问题类型 (SBA-R,SBA-I,真/错) 中显示出接近专家水平的性能.
- 所有评估的LLM都在基于图像的神经外科问题上表现出相当大的局限性.
- 目前的LLM是神经外科培训和临床决策支持的补充工具,而不是最终解决方案.


