对DeepSeek大型语言模型对医疗任务和临床推理进行比较比较
Mickael Tordjman1,2, Zelong Liu1, Murat Yuce1,2
1BioMedical Engineering and Imaging Institute, Icahn School of Medicine at Mount Sinai, New York, NY, USA.
Nature medicine
|April 23, 2025
概括
DeepSeek-R1在医疗任务中表现有希望,例如USMLE问题和诊断推理,其表现优于Llama 3.1-405B. 然而,与ChatGPT-o1.1.相比,它在总结成像报告方面的性能需要改进.
科学领域:
- 人工智能在医学中的应用
- 自然语言处理自然语言处理.
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于医学应用.
- DeepSeek-R1是一个新的LLM,具有先进的推理能力.
- 它在医学领域的有效性仍未得到评估.
研究的目的:
- 评估DeepSeek-R1.1.在医疗领域的功能.
- 在不同的医疗任务上,将DeepSeek-R1与ChatGPT-o1和Llama 3.1-405B进行比较.
- 在临床环境中识别DeepSeek-R1的优缺点.
主要方法:
- 三个LLM (DeepSeek-R1,ChatGPT-o1,Llama 3.1-405B) 的评估. 这是一个很好的方法.
- 在四个医疗任务中的绩效评估:USMLE问题,基于文本的案例解释,RECIST 1.1瘤分类和诊断成像报告总结.
- 对准确性和质量得分的统计分析.
主要成果:
- 在USMLE问题上,DeepSeek-R1取得了高精度 (0.92),略低于ChatGPT-o1 (0.95),但优于Llama 3.1-405B (0.83).
- 在基于文本的案例挑战和RECIST分类中观察到与ChatGPT-o1相似的性能.
- DeepSeek-R1的诊断推理步骤被评为高于其他LLM,但其成像报告摘要的质量低于ChatGPT-o1.1.
结论:
- DeepSeek-R1在医疗应用方面具有显著的潜力,特别是在诊断推理和标准化测试方面.
- 需要进一步发展的领域包括总结诊断成像报告的质量.
- 对比分析为未来的医疗保健LLM发展提供了宝贵的见解.


