整形外科医学教育における多肢選択問題の評価におけるChatGPTとDeepSeekの比較:横断研究
Chirathit Anusitviwat1, Sitthiphong Suwannaphisit2, Jongdee Bvonpanttarananon1
1Department of Orthopedics, Faculty of Medicine, Prince of Songkla University, 15 Karnchanavanich Road, Hat Yai, 90110, Thailand, 66 74451601.
JMIR formative research
|December 19, 2025
まとめ
ChatGPTは、整形外科多肢選択問題(MCQ)の評価においてDeepSeekよりも優れた性能を示し、より高い精度とより速い応答時間を示しました。これは、ChatGPTのような大規模言語モデル(LLM)が医学教育評価に効率的に役立つ可能性を示唆しています。
科学分野:
- 医学教育
- ヘルスケアにおける人工知能
- 整形外科
背景:
- 多肢選択問題(MCQ)は、医学知識と臨床推論の評価に不可欠です。
- 従来のMCQ開発は、リソース集約的であり、バイアスを受けやすいです。
- 大規模言語モデル(LLM)は、MCQ評価の効率化と精度向上の可能性を提供します。
研究 の 目的:
- 整形外科MCQの評価におけるChatGPTとDeepSeekのパフォーマンスを比較すること。
- LLM生成された回答の正しさ、応答時間、信頼性を評価すること。
- 両モデルが誤って回答したMCQにおける潜在的な曖昧さを特定すること。
主な方法:
- 横断研究で209の整形外科MCQを分析しました。
- ChatGPTとDeepSeekを使用してMCQに回答し、特定の機能に注意しました。
- 統計分析(χ2検定、Mann-Whitney U検定、Cohen κ)により、正しさ、応答時間、信頼性を比較しました。
- 整形外科教員が、両方のLLMによって誤って回答されたMCQをレビューしました。
主要な成果:
- ChatGPTはDeepSeek(74.2%)よりも高い正答率(80.38%)を達成しました(P = .04)。
- ChatGPTはDeepSeek(34.42秒)と比較して有意に短い応答時間(10.40秒)でした(P < .001)。
- ChatGPTはほぼ完全な一致(κ=0.81)を示しましたが、DeepSeekは実質的な一致(κ=0.78)でした。
結論:
- ChatGPTは、整形外科MCQ評価においてDeepSeekよりも効率的かつ正確です。
- LLMは、医学教育評価への統合に有望です。
- 一部のMCQは、明確性を向上させるために教員による改訂が必要であり、人間の監視の必要性を強調しています。
さらに関連する動画
06:28E-Patient Counseling Trial E-PACO: Computer Based Education versus Nurse Counseling for Patients to Prepare for Colonoscopy
Published on: August 1, 2019
8.7K
05:04Author Spotlight: Evaluating Clinicians' Adoption of Ultrasound-Guided Vascular Cannulation Through Simulation Training
Published on: August 9, 2024
1.4K
