人工知能(AI)ベースの敗血症およびARDSに対する包括的な臨床意思決定支援の評価:臨床医チューリングテストのプロトコル
Antonia Angeli Gazola1, Nicholas S Bishop1, Benjamin E Schmid1
1Palliative and Advanced Illness Research (PAIR) Center, University of Pennsylvania Perelman School of Medicine, Philadelphia, Pennsylvania, USA.
BMJ open
|December 25, 2025
まとめ
本研究では、敗血症およびARDS患者向けのAI人工呼吸器アシスタント(AVA)の安全性評価のために臨床医チューリングテストを導入する。臨床医がAVAの推奨を人間の推奨と区別できない場合、前臨床的安全性が示唆される。
科学分野:
- 集中治療医学
- ヘルスケアにおける人工知能
- 臨床意思決定支援システム
背景:
- AI臨床意思決定支援システム(CDSS)の実践における評価は、初期段階のデータが限られているため困難である。
- 敗血症や急性呼吸窮迫症候群(ARDS)などの病状に対する集中治療室(ICU)でのハイリスクな意思決定には、堅牢なAI検証が必要である。
- AI人工呼吸器アシスタント(AVA)は、人工呼吸中の敗血症ARDS患者のために開発されたが、予測性能だけでは安全性評価には不十分である。
研究 の 目的:
- AI人工呼吸器アシスタント(AVA)の安全性と適切性を評価するための新規臨床医チューリングテストを導入および検証する。
- 重症患者の臨床医が、敗血症ARDS患者の治療推奨におけるAI生成と人間生成の推奨を区別できるかどうかを判断する。
- 大規模な臨床展開の前に、AVAの安全性と適切性に関する前臨床的シグナルを提供する。
主な方法:
- 臨床医チューリングテストデザインを採用した多施設共同無作為化電子症例対照第1b相試験。
- 米国内6病院の350人の重症患者臨床医(医師、上級プラクティス提供者)を募集。
- 参加者は、AI生成または人間によって実施された治療計画を含む臨床症例をレビューし、ランダムに(1:1)割り付けられ、そのソースを特定した。主要評価項目:混合効果ロジスティック回帰によるソース特定における精度。
主要な成果:
- 本研究は、AI生成の治療推奨と人間生成の治療推奨を臨床医が区別する精度という主要評価項目を評価するように設計されている。
- 二次評価項目には、AI臨床意思決定支援システム(CDSS)に対する安全性、適切性、信頼性、および関心に関する臨床医の認識の評価が含まれる。
- 本研究は、実際の展開に伴うリスクなしに、AI CDSSの臨床的適切性に関する予備データを提供することを目的としている。
結論:
- 臨床医チューリングテストは、前臨床設定におけるAI CDSSの安全性と適切性を評価するための新規アプローチを提供する。
- AVAがチューリングテストに「合格」した場合、その安全性と適切性に関する強力な前臨床的シグナルが示される。
- この検証方法は、AI CDSSの将来の臨床実装および実世界環境での評価に関する意思決定に情報を提供する。

