人工智能是否在土耳其神经科学委员会考试中取得成功?
Ayse Betul Acar1, Ece Yanik2, Emine Altin3
1Departments of Neurology and Algology, Etlik City Hospital, Ankara, Turkiye.
Neurological research
|March 21, 2025
概括
在土耳其神经病学能力考试中,ChatGPT-4的成功率为79-82%,与GPT-3.5.5相比,表现更好. 这项研究突出了AI的优势.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 神经学 神经学
背景情况:
- 开放AI的GPT-4显示了在专业领域的高级功能.
- 医疗执照考试对于评估医生临床能力至关重要.
- 土耳其神经病学能力考试评估了神经病学方面的专业知识.
研究的目的:
- 评估ChatGPT-4在土耳其神经病学能力考试中的表现.
- 将ChatGPT-4的结果与以前的AI模型 (如GPT-3.5.5.) 进行比较.
- 评估语言翻译对医学考试中的AI表现的影响.
主要方法:
- 使用GPT-4版本的ChatGPT进行基于图像的问题处理.
- 从2021年,2022年和2023年土耳其神经学熟练考试到ChatGPT-4进行的多选择部分.
- 根据官方考试标准,使用土耳其语原始问题和答案.
主要成果:
- 在三个考试中,ChatGPT-4的成功率在79%至82%之间.
- 在重复的试验中确定了常见和明显的错误.
- 正确的答案是在重新评估最初不正确的答案后获得的.
结论:
- 这是第一个在真实世界的神经学能力考试中评估ChatGPT的研究.
- 与GPT-3.5.5相比,ChatGPT-4的成功率更高.
- 与GPT-3.5.5.不同的是,问题翻译并没有对GPT-4的表现产生负面影响.
- 人工智能的自适应学习能力允许纠正初始错误.
- 在医疗评估中使用人工智能时,建议谨慎和批判性评估.


