結腸直腸外科手術の質問ボードの生成における人工知能の性能
Jonathan Zuo1, Makenna Marty1, Seija Maniskas1
1Division of Colorectal Surgery, Huntington Health - an Affiliate of Cedars-Sinai, Pasadena, CA, USA.
American journal of surgery
|February 15, 2026
まとめ
大型言語モデル (LLM) は潜在的可能性を示していますが,まだ高品質の結腸直腸外科の試験質問を作成することはできません. 専門家によって開発された質問は,ボード式評価では,LLMで生成されたコンテンツを大幅に上回ります.
科学分野:
- 医療教育 医療教育について
- 医療における人工知能
- 外科研修の訓練を受けています.
背景:
- 大型言語モデル (LLM) は,医療免許試験に合格する能力を示します.
- LLMが質の高い,ボード式の医学試験の質問を生成する能力は,ほとんど未検討のままです.
- LLMで生成された質問の評価は,医学教育への潜在的な統合に不可欠です.
研究 の 目的:
- 大腸直腸外科手術の質を評価するために,3つの主要なLLMsによって生成されたボードスタイルの試験質問.
- 確立された教育資料に対してLLMで生成された質問を比較する.
- LLMで生成された質問が,取締役会認定試験の準備に適しているかどうかを判断する.
主な方法:
- 3つのLLMは,アメリカン・ボード・オブ・コロン・アンド・レクトル・サージュリジーのガイドラインに従って,それぞれ20個の結腸直腸外科の質問を作成しました.
- 結腸直腸外科教育プログラム (CARSEP) の質問が基準として使用されました.
- ボード認定の結腸直腸外科医は,質問の明確性,関連性,適性,注意をそらすことの質,合理性に基づいて質問を評価し",委員会に承認された"",審査対象の著作者"または"受け入れられていない"として分類しました.
主要な成果:
- CARSEPの質問は,最高"委員会承認"率 (65%) を達成し,LLM (ChatGPT-4o: 7%,Copilot Pro: 10%,Gemini Advanced: 10%) を大幅に上回りました.
- LLMは,ほとんどの評価領域でCARSEPを大幅に上回った (p <0.001).
- LLMで生成された質問は,適性について高い評価 (>70%) を受け,特定の側面での潜在性を示しました.
結論:
- 現在のLLMは,高品質の,ボード式の大腸直腸外科試験の質問を生成する能力が一貫してありません.
- LLMは有望ですが,外科委員会試験の厳格な基準を満たすためにさらなる開発が必要です.
- 専門家によって開発された質問バンクは,取締役会の準備と評価において優れている.


