医療教育における臨床シナリオ生成のための大規模言語モデルの比較:混合法研究
1Department of Medical Education, Faculty of Medicine, Aydın Adnan Menderes University, Aydın, Turkey. selcenoncu@gmail.com.
BMC medical education
|February 24, 2026
まとめ
クロードAIは、トルコの医学生にとって、現実的で教育的に健全な臨床症例シナリオを生成する上で優れたパフォーマンスを示した。このAIツールは、従来の医療教育方法を補完するものとして有望である。
科学分野:
- 医療教育
- ヘルスケアにおける人工知能
- 臨床シミュレーション
背景:
- 従来の臨床症例管理トレーニングは、患者の安全性、限られた機会、および教員のワークロードのために課題に直面している。
- 人工知能(AI)、特に大規模言語モデル(LLM)は、臨床トレーニングを補完するための革新的なソリューションを提供する。
- LLMは、能力ベースの医療教育のために、多様でインタラクティブな、文脈固有の臨床シナリオを生成できる。
研究 の 目的:
- 4つのLLM(ChatGPT-4o、Claude 3.7 Sonnet、Gemini 1.5、DeepSeek)の臨床シナリオ生成における有効性を評価および比較すること。
- LLM生成シナリオのトルコの学部医療教育における教育的有用性を評価すること。
- 国家基準に沿った、最も正確で理解しやすく、教育的に適切なコンテンツを生成するLLMを特定すること。
主な方法:
- 国家医療教育ガイドラインに基づいた標準化されたプロンプトを使用した、収束並行混合法設計。
- 各LLMによる3つの一般的な感染症に対するトルコ語の臨床シナリオの生成。
- 構造化された評価フォームと定性的なフィードバックを使用した25人の上級医学生と5人の専門家臨床医によるシナリオの評価。
主要な成果:
- クロード3.7ソネットは、明瞭さ、現実感、臨床推論サポートにおいて最高の評価を受けた。;統計的に有意な差が、クロードがジェミニとディープシークを上回った(p < 0.05)。;定性的なフィードバックでは、クロードの教育的価値と言語的精度が強調された。;ChatGPTは中程度のパフォーマンスを示し、ジェミニとディープシークは現実感と一貫性に問題を抱えていた。
結論:
- クロードは、学部医療教育のための臨床的に適切で教育的に有用なトルコ語のシナリオ生成において最高の評価を受けた。
- 本研究の結果は、LLM生成シナリオの品質に関する予備的な証拠を提供し、さらなる多施設共同および成果に焦点を当てた研究を支持する。
- 将来の研究では、シミュレーションベース学習における補助資料としてLLMシナリオを検討すべきである。


