对DeepSeek大语言模型在临床决策中的基准评价
Sarah Sandmann1, Stefan Hegselmann2, Michael Fujarski1
1Institute of Medical Informatics, University of Münster, Münster, Germany.
Nature medicine
|April 23, 2025
概括
像DeepSeek这样的开源大语言模型 (LLM) 与临床决策支持中的专有LLM相匹配. 这为医疗保健中的AI提供了一条安全,合规的途径.
科学领域:
- 人工智能在医学中的应用
- 临床信息学 临床信息学
- 医疗决策支持系统 医疗决策支持系统
背景情况:
- 专有大型语言模型 (LLM) 由于隐私法规,在医疗保健中面临采用障碍.
- 开源的LLM提供了在医院现场部署和数据定制的潜力.
研究的目的:
- 将开源DeepSeek模型的临床实用性与专有LLMs进行比较.
- 通过使用真实世界患者病例来评估临床决策支持任务的性能.
主要方法:
- 对比DeepSeek-V3和DeepSeek-R1与GPT-4o和Gemini-2.0闪电思维实验的性能.
- 进行了对125例不同疾病概况的患者病例的基准测试.
- 评估重点是临床决策支持能力.
主要成果:
- 深度搜索模型表现出与专有LLM相比的或更高的性能.
- 开源的LLM在临床决策支持任务中取得了高效.
- 在开源模型和专有模型之间没有发现显著的性能差异.
结论:
- 开源的LLM是临床决策支持的可行和有效的替代方案.
- 这些模型有助于在医疗保健环境中实现安全,合规和可扩展的AI.
- 深度搜索模型为推进医疗人工智能应用提供了一个有希望的途径.


