对放射学考试准备人工智能模型的评估:DeepSeek与ChatGPT-3.5对比
Na Hu1, Yunpeng Luo2, Pinggui Lei1
1Department of Radiology, The Affiliated Hospital of Guizhou Medical University, Guiyang, Guizhou Province, People's Republic of China.
Medical education online
|November 28, 2025
概括
人工智能聊天机器人DeepSeek-V3在回答放射学委员会式问题方面显著超过了ChatGPT-3.5,显示出医学教育的前景. 复杂的任务需要进一步精细化,但它在基础知识回忆方面表现出色.
科学领域:
- 医疗教育中的人工智能
- 放射学培训和评估 放射学培训和评估
- 医疗保健中的大型语言模型
背景情况:
- 人工智能聊天机器人正在迅速发展,人们对其在医学教育中的应用越来越感兴趣.
- 评估人工智能模型在放射学等专业领域的有效性对于教育融合至关重要.
研究的目的:
- 评估开源AI聊天机器人DeepSeek-V3在放射学委员会式问题上的表现.
- 为了比较DeepSeek-V3的准确性与ChatGPT-3.5用于放射学教育.
主要方法:
- 从资格考试中选择了161个放射学委员会式问题 (207项).
- 在7天的时间里,DeepSeek-V3和ChatGPT-3.5在相同的问题上进行了测试.
- 使用Pearson的千平方和费舍尔的精确测试来评估准确度.
主要成果:
- DeepSeek-V3的准确率达到了72%,明显高于ChatGPT-3.5的55.6% (P < 0.001).
- DeepSeek-V3在单选题 (87.1%) 中表现出色,但在多选题 (55.7%) 和案例分析 (68.0%) 中表现较差.
- 在多个临床子专业领域,DeepSeek-V3的表现优于ChatGPT-3.5,包括神经,呼吸,循环和肌肉骨系统.
结论:
- DeepSeek-V3显示出作为放射学教育的AI工具的潜力,特别是在基础知识和回忆方面.
- 该模型需要进一步开发,以提高高阶认知任务和复杂问题格式的性能.
- 未来的研究应该探索DeepSeek-V3的基于图像的查询功能,并将其与更先进的AI模型进行比较.


