AIを用いて一般外科研修の申請の可行性 個人的な声明
Pooja M Varman1, Shadae Nicholas2, Andrew Conner1
1Digestive Diseases Institute, Cleveland Clinic, Cleveland, Ohio.
Journal of surgical education
|August 30, 2025
まとめ
人工知能 (AI) は整体外科専攻の個人報告を一貫して得点したが,人間審査員とは違っていた. 微妙な申請審査には 人間の判断が不可欠です
科学分野:
- 医学教育
- 医療における人工知能
背景:
- 医学の大学院教育では 人工知能 (AI) の利用が増加しています
- 個人申告は主観的ですが,居住許可の申請には不可欠です.
- 研修プログラムでは 応用スクリーニングのために AIを評価しています
研究 の 目的:
- 整体外科のレジデンスPSを評価するために大きな言語モデル (LLM) を使用する可能性を評価する.
- 人工知能によって生成されたスコアと人間によって割り当てられたPSスコアを比較する.
主な方法:
- 668人の非特定の一般外科研修医を遡って分析した.
- 人間評価者 (HA) とGPT-3.5 (AI) によって,リーダーシップと経路の領域で1-5のスケールを用いてPSをスコアしました.
- AIとHAのスコアを記述的統計と加重カッパ係数で比較した.不一致の症例の質的レビュー.
主要な成果:
- AIとHAのスコアとの間の低い一致 (κ=0.184リーダーシップ, κ=0.120経路).
- AIはHAよりリーダーシップが低い (中位数3) と経路が高い (中位数4) でした (中位数4のリーダーシップ,中位数3の経路).
- AIは高いスコアに 明確なラベルを必要とし HAは回復力や情熱のような 推論された資質を認識しました
結論:
- 人工知能は一貫したルブリックの適用を示したが,PSは人間とは異なる解釈をした.
- AIは初期スクリーニングの一貫性とスケーラビリティを向上させる可能性があります.
- 応用における暗黙の意味と微妙な内容の評価には 人間の判断が不可欠です


