DeepSeek-R1,ChatGPT (GPT-o3-mini) 和Gemini 2.0 Flash在德国医学多选题上的表现:比较评估
Annika Meyer1, Yassin Karay2, Andrea U Steinbicker1
1Department of Anesthesiology and Operative Intensive Care, Faculty of Medicine and University Hospital, University Hospital Cologne, Cologne, Germany.
JMIR formative research
|December 18, 2025
概括
人工智能聊天机器人DeepSeek在德国的医疗问题上显示了与ChatGPT和Gemini相似的准确性. 它的离线功能为临床环境提供了一种保护隐私的替代方案,尽管性能可能会随着更长时间的问题而下降.
科学领域:
- 人工智能在医学中的应用
- 自然语言处理自然语言处理.
- 医疗教育 技术 技术 医学教育
背景情况:
- 人工智能聊天机器人在医疗领域提供了变革性的潜力,但也面临着数据隐私方面的挑战.
- DeepSeek 的离线功能为隐私问题提供了潜在的解决方案.
- 与基于云的模型相比,DeepSeek等离线AI聊天机器人的准确性仍未得到验证.
研究的目的:
- 评估DeepSeek对德国医学多选题 (MCQ) 的准确性.
- 为了比较DeepSeek与ChatGPT和Gemini的表现.
- 评估DeepSeek作为保护隐私的临床AI工具的可行性.
主要方法:
- 对ChatGPT,DeepSeek和Gemini进行了200个德国医学MCQ.
- 准确性定义为正确回答问题的比例.
- 使用科克兰Q和麦克纳马测试进行统计分析,并根据领域和问题长度进行子组分析.
主要成果:
- 所有的聊天机器人都超过了60%的通过门:DeepSeek (96%),Gemini (94%),ChatGPT (92.5%).
- 在模型之间的整体或对比比较中没有发现统计学上显著的差异.
- 较长的问题对DeepSeek和ChatGPT的表现产生了负面影响,但不影响双子座的表现.
结论:
- 在德国的医疗MCQ中,DeepSeek的表现与ChatGPT和Gemini相当.
- 深度搜索的离线功能和成本效益是有益的.
- 需要进一步的研究来确认DeepSeek在临床应用中的安全性和可靠性.
更多相关视频
09:00Author Spotlight: Validation of SICOLE-R for Assessing Cognitive and Reading Skills in Spanish-Speaking Children and Its Role in Personalized Education
Published on: August 16, 2024
1.2K
10:58Multimedia Battery for Assessment of Cognitive and Basic Skills in Mathematics BM-PROMA
Published on: August 28, 2021
4.9K
