人工知能対人間の麻酔教育ビデオ評価:検証された品質スケールを使用した比較分析
Kubra Taskin1, Hulya Yilmaz Ak1
1Department of Anesthesiology and Reanimation, Kartal Dr. Lütfi Kırdar City Hospital, University of Health Sciences, Istanbul, Türkiye.
Frontiers in medicine
|February 25, 2026
まとめ
YouTubeの人間作成の麻酔教育ビデオは、AI生成のビデオよりも評価が高かった。しかし、ChatGPT-5はビデオ品質の評価において人間の専門家と強い一致を示し、コンテンツ評価におけるAIの可能性を示唆した。
科学分野:
- 医学教育
- 人工知能
- 麻酔科学
背景:
- YouTubeは医学教育で人気のあるプラットフォームであるが、ビデオの品質と正確性が懸念されている。
- 従来の品質評価は、DISCERN、JAMA、GQSなどのスケールを使用した人間の専門家に依存している。
- 大規模言語モデル(LLM)は、スケーラブルで客観的なコンテンツ評価の新たな可能性を提供する。
研究 の 目的:
- 人間対AIによって生成された麻酔ビデオの教育品質を比較すること。
- ビデオ品質の人間の専門家による評価とChatGPT-5による評価との一致を評価すること。
主な方法:
- 40のYouTube麻酔ビデオ(人間生成20件、AI生成20件)を対象とした横断的研究を実施した。
- 2人の麻酔科医とChatGPT-5が、DISCERN、JAMA、GQSの基準を使用してビデオを評価した。
- 評価者間信頼性(ICC)と相関(Spearmanのrho)を計算した。
主要な成果:
- 人間生成ビデオは、DISCERNおよびJAMAスコアにおいてAIビデオを大幅に上回った(p < 0.05)。
- グローバル品質スケール(GQS)スコアに有意差は見られなかった。
- ChatGPT-5は、すべてのスケールで人間の専門家の評価と強い一致を示した(ρ > 0.76、p < 0.001)。
結論:
- ChatGPT-5のようなAIモデルは、教育コンテンツ評価における人間の専門家の判断を近似する可能性を示している。
- 人間生成コンテンツは透明性に優れているが、AI生成コンテンツは構造と流暢性において同等である。
- AI支援評価は、医療教育ビデオアーカイブのスクリーニングのための標準化された効率的なツールを提供できる。
さらに関連する動画
06:19Integration of Animal Behavioral Assessment and Convolutional Neural Network to Study Wasabi-Alcohol Taste-Smell Interaction
Published on: August 16, 2024
07:28Web-based Clinician Guide to Record Compatible Video of Standardized Drinking Task Kinematics for Computer Vision Analysis
Published on: November 28, 2025
