评估先进的AI推理模型:聊天GPT-4.0和DeepSeek-R1诊断性能在耳鼻喉科:一个比较分析
Soumil Prasad1, Jake Langlie2, Luke Pasick2
1Department of Otolaryngology, University of Miami Miller School of Medicine, 1600 NW 10(th) Ave, Miami, FL 33131. United States of America..
American journal of otolaryngology
|May 14, 2025
概括
两个先进的人工智能 (AI) 模型ChatGPT-4.0和DeepSeek-R1在耳鼻喉学中显示出诊断潜力,但缺乏全面的临床细节来提供面向患者的信息. 为了准确,细微的决策支持,需要进一步改进人工智能.
科学领域:
- 耳鼻喉科 耳鼻喉科 耳鼻喉科
- 人工智能在医学中的应用
- 医疗信息学 医疗信息学
背景情况:
- 人工智能 (AI) 越来越多地被用于医学应用.
- 评估AI诊断准确性和临床相关性对于安全整合至关重要.
- 耳鼻喉科提供复杂的程序,需要详细的患者信息.
研究的目的:
- 评估ChatGPT-4.0和DeepSeek-R1.0的诊断准确性,全面性和临床相关性.
- 评估人工智能模型的面向患者的信息充分性,用于常见的耳鼻喉科手术.
主要方法:
- 分析了五种常见的耳鼻喉科手术 (腺切除术, tympanoplasty,内镜外科手术,切除术,全喉切除术).
- 对ChatGPT-4.0和DeepSeek-R1.0提出的标准化,类似患者搜索的查询.
- 独立评估AI对临床指南的准确性,相关性和全面性的反应.
主要成果:
- 聊天GPT-4.0提供了详细的程序见解,但偶尔建议过度成像和错过的外科细微差别.
- DeepSeek-R1提供了简洁,结构化的响应,但缺乏详细的详细阐述技术和轻微的并发症.
- 两种AI模型都没有充分解决全面的分期,详细的手术规划或复杂手术的长期恢复问题.
结论:
- 这两种AI模型都有诊断潜力,但在精度和全面性方面存在局限性.
- 目前AI在耳鼻喉科的临床实用性受到限制,因为缺乏细微的临床推理.
- 持续的AI改进是必要的,以改善耳鼻喉科的患者特定决策支持.


