人工知能による評価の可行性:大型言語モデルは人間の評価者を置き換えるのか?
Michael Jaworski1, Jacob Balconi2, Celeste Santivasci3
1Department of Psychology, Louisiana State University, Baton Rouge, LA, USA.
The Clinical neuropsychologist
|September 1, 2025
まとめ
ChatGPT-4.5は,一般公開前の多発性硬化症のための簡略国際認知評価 (BICAMS) のスコア付けにおいて高い精度を示しています. しかし,その信頼性は放出後に低下し,最適化による神経心理学的評価においてLLMの可能性を示した.
科学分野:
- 神経科学
- 人工知能
- 医療情報学
背景:
- 多発性硬化症のための簡潔な国際認知評価 (BICAMS) のような神経心理学的評価は,疾患の進行を監視するために極めて重要です.
- 手動でのスコア付けは時間がかかり 人間のエラーが起こりやすい.
- 大型言語モデル (LLM) は,このようなタスクを自動化する可能性を秘めています.
研究 の 目的:
- BICAMSプロトコルの自動スコア付けのためにChatGPT-4.5を使用する実現性,正確性,および信頼性を評価する.
- ChatGPT-4.5のスコアを 人間と比べるためだ
主な方法:
- 35の未確認のBICAMSプロトコル (SDMT,CVLT-II,BVMT-Rを含む) は,2人の評価者およびChatGPT-4.5によって評価された.
- スコアリングには,プロトコルスキャンをアップロードし,ChatGPT-4.5の構造化されたプロンプトを使用しました.
- インターレーターの信頼性,正確性,スピードは,ICC,tテスト,記述的統計を用いて評価された.
主要な成果:
- 公開前に,ChatGPT-4.5はヒトの評価者との強い信頼性を示した (例えば,CVLT-II ICC = 0.992,SDMT ICC = 1,000).
- ChatGPT-4.5は,プロトコルごとに9分未満でスコア付けを完了し,人間の評価者が見逃したエラーを特定しました.
- 公開後,信頼性は著しく低下した (例えば,BVMT-R試験3 ICC = -0.046) であり,スコア差異は増加した.
結論:
- ChatGPT-4.5は,特に公開される前に,BICAMSプロトコルのスコア付けにおいて,人間の評価者と同等の精度を示した.
- パフォーマンスの変動は公開後に発生し,モデルと迅速な最適化の必要性を強調しました.
- LLMは神経心理学的評価を簡素化し,効率を向上させ,計算リソースと最適化が充実している場合にエラーを減らすことを約束します.


