比较ChatGPT和DeepSeek用于评估骨科医学教育中的多选择题:跨部分研究
Chirathit Anusitviwat1, Sitthiphong Suwannaphisit2, Jongdee Bvonpanttarananon1
1Department of Orthopedics, Faculty of Medicine, Prince of Songkla University, 15 Karnchanavanich Road, Hat Yai, 90110, Thailand, 66 74451601.
JMIR formative research
|December 19, 2025
概括
在评估骨科多选题 (MCQ) 方面,ChatGPT在DeepSeek上表现出优异的性能,显示出更高的准确性和更快的响应时间. 这表明,像ChatGPT这样的大型语言模型 (LLM) 可以有效地帮助医学教育评估.
科学领域:
- 医疗教育 医学教育
- 医疗保健中的人工智能
- 整形外科手术 整形外科手术
背景情况:
- 多选题 (MCQ) 对于评估医学知识和临床推理至关重要.
- 传统的MCQ开发是资源密集型的,容易产生偏见.
- 大型语言模型 (LLM) 提供了有效和准确的MCQ评估的潜力.
研究的目的:
- 为了比较ChatGPT和DeepSeek在评估骨科MCQ中的表现.
- 评估LLM生成答案的正确性,响应时间和可靠性.
- 为了识别MCQ中的潜在含糊性,两种模型都回答了不正确的答案.
主要方法:
- 一项横截面研究分析了209个骨科MCQ.
- 使用ChatGPT和DeepSeek来回答MCQ,并指出特定的功能.
- 统计分析 (χ2测试,曼-惠特尼U测试,科恩 κ) 比较了正确性,响应时间和可靠性.
- 骨科教师审查了MCQs,两位LLMs都回答错误.
主要成果:
- 比起DeepSeek (74.2%;P=.04),ChatGPT的准确性更高 (80.38%),而不是DeepSeek (74.2%;P=.04).
- 与DeepSeek (34.42s;P<.001) 相比,ChatGPT的响应时间明显更短 (10.40s).
- 聊天GPT显示几乎完美的协议 (κ=0.81),而DeepSeek有实质性的协议 (κ=0.78).
结论:
- 在骨科MCQ评估中,ChatGPT比DeepSeek更有效和准确.
- 在医学教育评估中,LLM显示了整合的前景.
- 一些MCQ需要教师修订以提高清晰度,强调需要人类监督.
更多相关视频
06:28E-Patient Counseling Trial E-PACO: Computer Based Education versus Nurse Counseling for Patients to Prepare for Colonoscopy
Published on: August 1, 2019
8.7K
05:04Author Spotlight: Evaluating Clinicians' Adoption of Ultrasound-Guided Vascular Cannulation Through Simulation Training
Published on: August 9, 2024
1.4K
