在检测阿尔茨海默氏症痴呆症方面,ChatGPT与Bard的性能评估
Balamurali B T1, Jer-Ming Chen1
1Science, Mathematics & Technology (SMT), Singapore University of Technology & Design, 8 Somapah Rd, Singapore 487372, Singapore.
Diagnostics (Basel, Switzerland)
|April 26, 2024
概括
大型语言模型显示出从语音中识别阿尔茨海默氏症痴呆症 (AD) 的前景,但目前的ChatGPT和Bard等模型尚未足够可靠用于临床使用.
科学领域:
- 人工智能的人工智能
- 计算语言学 计算语言学
- 神经科学是一个神经科学.
背景情况:
- 大型语言模型 (LLM) 在各种领域越来越多地被使用.
- 区分阿尔茨海默氏症痴呆症 (AD) 和认知正常 (CN) 状态对于早期干预至关重要.
研究的目的:
- 评估三个著名的LLM聊天机器人 (ChatGPT-3.5,ChatGPT-4,Bard) 在识别AD和CN个人的有效性.
- 通过零射击学习方法,通过自发语音录音的文本数据来评估LLM绩效.
主要方法:
- 三个LLM聊天机器人使用自发语音转录进行了测试.
- 使用零射击学习方法,使用单次和链式思维提示.
- 使用准确度,灵敏度,特异性,精度和F1分数来量化AD和CN分类的性能.
主要成果:
- 所有测试的LLM在区分AD和CN时都超过了机会级别的表现.
- 巴德在阿尔茨海默病识别方面表现出高回忆率 (89%) 和F1得分 (71%),但表现出自信错误分类的倾向.
- 在CN识别方面,ChatGPT-4获得了更高的真负 (56%) 和F1得分 (62%),表现出更谨慎的反应.
结论:
- 根据语音数据,LLM聊天机器人显示了基于AD与CN分类的潜力.
- 目前的LLM绩效,尽管超过了机会水平,但不符合临床诊断应用的严格要求.


