大型语言模型在肺癌临床决策中的表现:基于DeepSeek,Grok和GPT的比较分析
Yuyang Zhang1, Dandan Yang2, Yifan Shi3
1Department of Surgery, Jinzhou Medical University, Jinzhou, CHN.
Cureus
|December 24, 2025
概括
与DeepSeek-R1和GPT-4.5相比,Grok-3在肺癌诊断的临床问题答案方面表现优越,在人工智能驱动的临床支持中提供了更高的准确性和信心.
科学领域:
- 人工智能在医学中的应用
- 在瘤学瘤学.
- 医学成像分析 医学成像分析
背景情况:
- 大型语言模型 (LLM) 在医学成像和指南分析方面表现有前途.
- 有限的研究存在于专门用于肺癌诊断和护理的LLM应用.
研究的目的:
- 评估和比较三个领先的LLM (DeepSeek-R1,Grok-3,GPT-4.5) 在解决肺癌特定临床问题的表现.
- 评估LLM响应的准确性,完整性和实用性,以加强AI驱动的肺癌临床决策.
主要方法:
- 定义了与肺癌相关的五个不同的临床领域.
- 具体的临床问题被制定和提出给每一个LLM.
- 答案由三个胸部外科专家对准确性,完整性和实用性进行了评估.
主要成果:
- 与DeepSeek-R1和GPT-4.5.5相比,Grok-3的响应时间更长,整体性能得分更高.
- 在所有五个临床领域中,Grok-3获得了最高的分数.
- Grok-3在识别文本中的医疗图像方面表现出最高的信心,而DeepSeek和GPT-4.5更容易暗示罕见或传染性疾病.
结论:
- 格罗克-3显示出在肺癌诊断和管理中提供临床支持的巨大潜力.
- 专家评估强调了Grok-3在肺癌相关查询的准确性和完整性方面的优势.
- 需要进一步的研究来完善LLM的表现,特别是在复杂病例的差异诊断中.

