人工知能対ヒトによる医療面接の記録の評価,生成型人工知能シミュレート患者システム: 横断的な検証研究
Hiromizu Takahashi1, Kiyoshi Shikino2, Takeshi Kondo3,4
1Department of General Medicine, Faculty of Medicine, Juntendo University, 3-1-3 Hongo, Bunkyo Tokyo, 1130033 Japan, Tokyo, Japan, 81 3-3813-3111.
JMIR medical education
|February 17, 2026
まとめ
AIベースのアセスメント (ABA) は,仮想患者インタビューのヒトベースのアセスメント (HBA) と密接に一致し,信頼性があり,より迅速な代替案を提供します. この技術は,医療教育の効率を向上させ,医学の教員の作業量を減らすことができます.
科学分野:
- 医療教育 テクノロジー テクノロジー
- 医療における人工知能
- クリニックスキルの評価
背景:
- 生成型人工知能 (AI) は,仮想患者のシミュレーションのための医療教育でますます利用されています.
- 臨床面接におけるAIベースの評価 (ABA) と従来のヒトベースの評価 (HBA) の比較性は,まだ十分に研究されていない.
研究 の 目的:
- 人工知能 (GPT-o1 Pro,GPT-5 Pro) の臨床面接評価の質を人間の評価者と比較する.
- 異なる臨床経験レベルでの評価時間と合意に対するAIの影響を評価する.
主な方法:
- 標準化された足の弱さ症例は,AI仮想患者を通して,7人の参加者に提示されました.
- インタビューの記録は,AIツールと盲目の臨床インストラクターの両方によって,マスター・インタヴュー・レーティング・スケールを使用してスコア付けられました.
- 信頼性と合意は,相関係数,Bland-Altman分析,Cronbach's alphaを用いて評価され,時間効率が測定されました.
主要な成果:
- AIベースの評価 (ABA) のスコアは,ヒトベースの評価 (HBA) のスコアを密接に反映した (r=0.90,コンコンダンス相関係数=0.88).
- ABAは,HBAと比較して,より優れた一貫性 (より低い変数係数:6.6%対13.9%) と信頼性 (ICC: 0.77-0.82) を示した (ICC: 0.38).
- AIは評価時間を大幅に短縮し,GPT-5 Proは人間の評価者と比較して67.6%の削減を提供しました.
結論:
- AIベースの評価は,仮想患者のインタビューのための人間ベースの評価に有効な,一貫した,迅速な代替案を提供します.
- ABAは,効率を高め,タイムリーなフィードバックを可能にし,医療訓練の設定における教員の作業量を減らすことができます.
- ABAの汎用性を様々な教育文脈で確認するために,さらなる研究が推奨されています.

