对ChatGPT-4o和DeepSeek-V3在头部和部瘤学中的比较评价
Burçay Tellioğlu1, Erim Pamuk1, Çağrı Külekci1
1Department of Otolaryngology Head and Neck Surgery, Hacettepe University Medical School, Ankara, Turkey.
Acta oto-laryngologica
|October 28, 2025
概括
大型语言模型 (LLMs) 在回答头癌 (HNC) 问题时显示出高准确度. 这些人工智能工具为临床决策支持和HNC护理中的患者教育提供了潜力.
科学领域:
- 人工智能在医学中的应用
- 自然语言处理自然语言处理.
- 在瘤学瘤学.
背景情况:
- 大型语言模型 (LLM) 越来越多地融入临床决策和患者教育.
- 它们的应用扩展到复杂的医疗专业,如头癌 (HNC).
研究的目的:
- 评估ChatGPT-4o和DeepSeek-V3在响应HNC相关的临床查询方面的表现.
- 评估AI响应的准确性,可重复性和模型间一致性.
主要方法:
- 使用了一套精心策划的154个HNC临床问题,涉及6个类别.
- 对ChatGPT-4o和DeepSeek-V3.3两者提出了两次问题.
- 头部和部外科医生独立评估了反应,使用四点准确度表.
主要成果:
- 聊天GPT-4o获得了92.2%的准确性,而DeepSeek-V3获得了89.6%的准确性 (p=0.42).
- 这两种模型都显示出高可重现性 (ChatGPT-4o:96.1%;DeepSeek-V3:96.8%).
- 模型之间的统计一致性很低 (科恩的 κ=0.12,ICC=0.21,p=0.006).
结论:
- 对于与HNC相关的问题,ChatGPT-4o和DeepSeek-V3都表现出强大的准确性和一致性.
- 在HNC临床决策和患者教育中,LLM显示出作为可靠工具的承诺,只要考虑到局限性.


