関連する実験動画
Updated: May 6, 2026

07:30
Learning Modern Laryngeal Surgery in a Dissection Laboratory
Published on: March 18, 2020
8.2K
専門医と外科研修生による比較研究
1Department of Gastrointestinal Surgery, Afyonkarahisar State Hospital, Afyonkarahisar, Türkiye. opdrmelihcangul@gmail.com.
BMC medical education
|August 24, 2025
まとめ
人工知能 (AI) のモデルは,試験の質問で人間の外科医よりも低い精度を示しています. AIのツールは 外科教育における専門家の臨床判断を 補うのに最適です
科学分野:
- 医学教育
- 人工知能
- 手術 評価
背景:
- 人工知能 (AI) は医療教育と評価でますます使用されています.
- GPT-4oのようなAIモデルでは 高リスクの医療検査では 性能が変動します
- この研究では人工知能の性能を 人間の専門家と比較して 検査するものです
研究 の 目的:
- 4つのAIモデル (Llama-3,Gemini,GPT-4o,Copilot) の精度を,欧州総合外科委員会 (European General Surgery Board) の質問に対する専門家とレジデントと比較する.
- 質問形式,長さ,難易度に基づいてAIのパフォーマンスを分析します.
- 手術教育と評価における AI の現在の役割を決定する.
主な方法:
- 整体外科試験の複数選択の質問が 120 件使用されました.
- 4人のAIモデルと30人の外科医 (スペシャリストとレジデント) がタイムリーな条件で質問に答えました
- 質問は長さや難易度によって分類され,正確さはANOVAを用いて比較された.
主要な成果:
- 認定外科医は81.6%の精度で 定員医は69.9%の精度で
- Llama-3はAIモデルの中で最高の65.8%で,Copilotは51.7%で最低でした.
- 人工知能の性能は質問の長さや難易度によって 低下しました 人工知能の性能とは違います
結論:
- 現在の大型言語モデル (LLM) は,高度な医療知識の評価において,ヒトの専門家に劣っている.
- LLMは外科教育の貴重な補足ツールです.
- AIは専門医の臨床判断を 置き換えるべきではありません

