在一个复杂的诊断挑战中,DeepSeek-R1和GPT-4是相似的:一个历史对照研究
Lining Chan1, Xinjie Xu, Kaiyang Lv
1Department of Plastic Surgery, Xinhua Hospital, Shanghai Jiao Tong University School of Medicine, Shanghai, People's Republic of China.
International journal of surgery (London, England)
|June 12, 2025
概括
在复杂的医疗病例中,DeepSeek-R1的诊断准确度与GPT-4相似. 虽然这两种模型在最终诊断方面表现相似,但DeepSeek-R1提供了更多样化的差异诊断范围.
科学领域:
- 人工智能在医学中的应用
- 计算语言学 计算语言学
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 在医学诊断中表现有前途.
- 在复杂的临床场景中评估LLM准确性至关重要.
- DeepSeek-R1是一个开源的LLM,具有先进的推理能力.
研究的目的:
- 为了评估DeepSeek-R1.1.的诊断性能.
- 将DeepSeek-R1的诊断准确性与GPT-4进行比较.
- 在复杂的病例中评估差异诊断生成.
主要方法:
- 一项历史性对照研究利用了来自NEJM的100个临床病理病例.
- DeepSeek-R1使用结构化诊断提示符处理病例.
- 绩效指标包括最终诊断的准确性,差异性纳入,排名和质量得分.
主要成果:
- DeepSeek-R1实现了35%的最终诊断准确度,与GPT-4的39% (P=0.634) 相比.
- DeepSeek-R1的差异诊断纳入率 (48%) 低于GPT-4的 (64%;P=0.036).
- DeepSeek-R1产生了更长的差异,但保持了类似的正确诊断排名和质量评分.
结论:
- DeepSeek-R1的诊断准确度与GPT-4的诊断准确度相当.
- DeepSeek-R1可以产生更多样化的差异诊断.
- 由于DeepSeek-R1的开源性质,医疗AI应用可能会受益.


