系統的なレビューとメタ解析
Sholem Hack1, Rebecca Attal1, Armin Farzad1
1City St. Georges University London School of Medicine, Program Delivered by University of Nicosia at the Chaim Sheba Medical Center, Ramat Gan, Israel.
Auris, nasus, larynx
|September 5, 2025
まとめ
人工知能は耳鼻喉科の教育や コミュニケーションの課題に 期待を寄せています しかし,臨床的推論におけるその不一致は,安全な実践への統合のためのさらなる研究を必要とします.
科学分野:
- 耳鼻喉科
- 人工知能
- 医療情報工学
背景:
- ジェネラティブAI,特にLarge Language Models (LLM) は,医療応用のためにますます探索されています.
- 耳鼻喉科のような専門分野でのLLMの有効性を評価することは,その可能性と限界を理解するために不可欠です.
研究 の 目的:
- 耳鼻科におけるジェネラティブAIの診断の正確性,教育的有用性,コミュニケーション能力を体系的に評価する.
- 耳鼻喉科に関連するタスクにおいて,異なるLLMバージョン (例えば,GPT-4対GPT-3.5) の性能の変動を分析する.
主な方法:
- 2022年1月から2025年3月までの間に発表された研究について,主要な科学データベース (PubMed,Embase,Scopus,Web of Science,IEEE Xplore) で包括的な文献検索が行われました.
- 耳鼻喉科におけるテキストベースの生成AIを評価する適格な研究は,JBIとQUADAS-2ツールを用いてスクリーニングおよび評価された.
- タスクタイプとAIモデルのバージョンに基づくサブグループ分析により,診断精度データに関するランダム効果メタ分析が行われました.
主要な成果:
- 59のモデル・タスク・ペアで定量的な診断精度データを提供した研究が43件含まれていた.
- 耳鼻喉科におけるジェネラティブAIの統合診断の精度は72. 7%で,臨床的意思決定支援 (67. 1%) に比べて教育 (83. 0%) と診断画像 (84. 9%) の精度は高かった.
- GPT-4はGPT-3. 5よりも優れたパフォーマンスを示したが,複雑な臨床推論では幻覚やパフォーマンスの変動性などの課題が観察された.
結論:
- ジェネラティブAIは,構造化された耳鼻喉科のタスク,特に教育とコミュニケーションにおいて,強力なパフォーマンスを示しています.
- 臨床的推論における現在の不一致は,患者ケアにおける生成AIの単独の適用を制限しています.
- 将来の研究は,AIの幻覚を緩和し,標準化された評価指標を確立し,安全な臨床統合のための将来的な検証研究を行うことを優先すべきである.

