评估人工智能模型:使用神经心理学中的正式多选择题进行性能验证
Alejandro García-Rudolph1,2,3, David Sanchez-Pinsach1,2,3, Eloy Opisso1,2,3
1Departmento de Investigación e Innovación, Institut Guttmann, Institut Universitari de Neurorehabilitació adscrit a la UAB, Badalona, Barcelona, Spain.
概括
先进的AI语言模型显示出临床神经心理学教育的前景. 在船上认证类问题上,GPT-4.0的表现优于GPT-3.5,表明AI.
科学领域:
- 神经科学是一个神经科学.
- 人工智能的人工智能
- 医学教育 医学教育
背景情况:
- 可访问和高质量的教育对于临床神经心理学的进步至关重要.
- 在临床神经心理学中获得董事会认证的障碍包括时间限制和知识差距.
- 人工智能 (AI) 语言模型为教育挑战提供了潜在的解决方案.
研究的目的:
- 为了评估高级AI语言模型GPT-3.5和GPT-4.0的性能,临床神经心理学委员会认证类似的问题.
- 确定人工智能模型在神经心理评估和解释方面遇到困难的特定领域.
主要方法:
- 使用300个类似于临床神经心理学问题的美国专业心理学委员会对GPT-3.5和GPT-4.0的绩效评估.
- 对GPT-3.5和GPT-4.0.0之间的准确率进行比较分析.
- 对错误回答的问题进行主题分析,特别是在"评估"类别内.
主要成果:
- 与GPT-3.5 (65.7%) 相比,GPT-4.0实现了显著更高的准确率 (80.0%).
- 在"评估"类别中,GPT-4.0的准确率为73.4%,而GPT-3.5的准确率为58.6% (p=0.012).
- 主题分析揭示了"神经退行性疾病"和"神经心理测试和解释"的关键AI知识缺口.
结论:
- 先进的AI语言模型,特别是GPT-4.0,在支持临床神经心理学教育和董事会认证准备方面显示出相当大的潜力.
- 人工智能模型需要进一步开发,以解决神经退行性疾病和测试解释等复杂领域的特定知识差距.
- 人工智能工具可以通过提供可访问和专业的知识资源来帮助克服教育障碍.


