基于人工智能的评分可行性:大型语言模型能否取代人类评分?
Michael Jaworski1, Jacob Balconi2, Celeste Santivasci3
1Department of Psychology, Louisiana State University, Baton Rouge, LA, USA.
The Clinical neuropsychologist
|September 1, 2025
概括
在公开发布之前,ChatGPT-4.5在多发性硬化症简要国际认知评估 (BICAMS) 中显示出高准确度. 然而,其可靠性在释放后下降,表明在神经心理评估中LLM的潜力.
科学领域:
- 神经科学
- 人工智能
- 医疗信息学
背景情况:
- 神经心理评估如多发性硬化症简要国际认知评估 (BICAMS) 对于监测疾病进展至关重要.
- 这些评估的手动评分耗时且容易出现人为错误.
- 大型语言模型 (LLM) 提供了自动化此类任务的潜力.
研究的目的:
- 评估使用ChatGPT-4.5用于自动评分BICAMS协议的可行性,准确性和可靠性.
- 将ChatGPT-4.5的评分性能与人类评分器进行比较.
主要方法:
- 三十五个未识别的BICAMS协议 (包括SDMT,CVLT-II,BVMT-R) 得到了两个人类评级者和ChatGPT-4.5的评分.
- 评分包括上传协议扫描和使用ChatGPT-4.5的结构提示.
- 使用ICC,t测试和描述性统计数据评估了测量器之间的可靠性,准确性和速度.
主要成果:
- 在公开发布之前,ChatGPT-4.5与人类评分器之间表现出强大的可靠性 (例如,CVLT-II ICC = 0.992,SDMT ICC = 1.000).
- ChatGPT-4.5 完成了每条协议9分钟的评分,并发现了人类评分人员错过的错误.
- 在公开发布后,可靠性显著下降 (例如,BVMT-R试验3 ICC = -0.046),评分差异增加.
结论:
- 在评分BICAMS协议时,ChatGPT-4.5的准确性与人类评分器相美,特别是在公开发布之前.
- 在公开发布后出现了性能变化,突出显示了对模型和快速优化的需求.
- 提供足够的计算资源和优化,LLM有望简化神经心理评估,提高效率和减少错误.


