关于儿童委员会准备问题的DeepSeek和GPT模型的表现:比较评估
Masab Mansoor1, Andrew Ibrahim2, Ali Hamide1
1Louisiana Campus, Edward Via College of Osteopathic Medicine, 4408 Bon Aire Dr, Monroe, LA, 71203, United States, 1 5045213500.
JMIR AI
|August 27, 2025
概括
在小儿科考试中测试了三种人工智能 (AI) 模型. DeepSeek-R1的准确率达到了98.1%,超过了人类的合格率,并显示了医学教育的潜力.
科学领域:
- 医疗教育中的人工智能
- 医疗保健的大型语言模型 (LLM)
背景情况:
- 有限的研究评估了AI在标准化儿科评估中的表现.
- 这项研究解决了儿童医疗委员会准备中评估人工智能能力的需要.
研究的目的:
- 评估和比较三个领先的LLM在儿科委员会考试准备问题的表现.
- 将人工智能性能与人类医生的基准进行比较.
主要方法:
- 分析了2023年预备考的266个选择题.
- 对DeepSeek-R1,ChatGPT-4和ChatGPT-4.5的评估
- 人工智能表现与美国儿科委员会公布的第一次通过率的比较.
主要成果:
- 深度搜索R1的准确率达到了98.1%,超过了典型的通过率.
- 聊天GPT-4.5的准确率达到96.6%,这是人类表现的上限.
- ChatGPT-4的准确率达到了82. 7%,相当于人类较低的通过率.
- 人工智能模型难以整合复杂的临床表现和罕见疾病知识.
结论:
- DeepSeek-R1的卓越表现显示出其在医学教育和临床支持方面的潜力.
- 需要进一步的研究来探索AI在复杂的临床推理方面的能力.
更多相关视频
07:44Establishment of Orthotopic Patient-derived Xenograft Models for Brain Tumors using a Stereotaxic Device
Published on: May 2, 2025
360
05:56Implementation of Non-invasive Point of Care Transient Elastography for Evaluation of Liver Disease in Pediatric Populations with Cystic Fibrosis
Published on: August 29, 2025
20
