大型语言模型在口语理解评估中的可行性:混合方法可行性研究
Dorit Hadar-Shoval1, Maya Lvovsky1, Kfir Asraf1
1Department of Psychology, Max Stern Academic College of Emek Yezreel, Afula, Israel.
JMIR formative research
|February 24, 2025
概括
大型语言模型 (LLM) 显示出创造可访问的基于人工智能的口语理解测试 (AI-BVCT) 的希望. 这些AI-BVCT与传统评估有很强的一致性,这表明个性化认知评估的潜力.
科学领域:
- 认知心理学 认知心理学
- 人工智能的人工智能
- 心理测量 心理测量 心理测量
背景情况:
- 认知评估在应用心理学中至关重要.
- 访问有限和高成本阻碍了传统的评估.
- 开发可访问和负担得起的评估工具至关重要.
研究的目的:
- 评估使用大型语言模型 (LLM) 进行基于人工智能的口语理解测试 (AI-BVCTs) 的可行性.
- 将AI-BVCT的分数与传统的口头智力评估进行比较.
- 探索AI在提高认知评估可访问性方面的潜力.
主要方法:
- 采用了参与者内部设计.
- 来自AI-BVCTs (由Claude生成) 的得分与韦克斯勒成人智力尺度-III (WAIS-III) 语言理解指数 (VCI) 进行了比较.
- 八名讲希伯来语的参与者完成了这两种评估类型.
主要成果:
- 在AI-BVCT和VCI分数之间发现了强烈的一致性 (Claude: CCC=.75; GPT-4: CCC=.73).
- 皮尔森相关性表明VCI和AI-BVCT得分之间存在显著的关联 (Claude: r=.84; GPT-4: r=.77).
- 在AI-BVCT和VCI得分之间没有观察到统计学上显著的差异.
结论:
- 通过AI-BVCT,LLM显示了通过AI-BVCT评估口头智能的潜力.
- 基于人工智能的认知测试可以提高评估的可访问性和可负担性.
- 要验证这种方法,需要考虑道德问题,并对各种样本进行进一步的研究.
关键词:
人工智能在心理诊断中的应用这是WAIS-III.韦克斯勒成人智力量表人工智能的人工智能是人工智能.计算机化认知评估中的伦理学大型语言模型.个性化智能测试是个性化的智能测试.心理测试的有效性心理测试的有效性语言理解评估语言理解评估.语言理解指数 语言理解指数

