大型语言模型在耳鼻喉科的比较诊断能力
Akshay Warrier1, Rohan Singh1, Afash Haleem1
1Department of Otolaryngology-Head and Neck Surgery, Rutgers New Jersey Medical School, Newark, New Jersey, U.S.A.
The Laryngoscope
|April 2, 2024
概括
与谷歌Bard和Bing-GPT4.5相比,ChatGPT-3.5在诊断耳鼻喉病例方面表现出最高的准确性. 虽然大型语言模型显示出前景,但临床监督对于防止潜在的错误信息至关重要.
科学领域:
- 耳鼻喉科 耳鼻喉科 耳鼻喉科
- 人工智能的人工智能
- 医学诊断 医学诊断 医学诊断
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于临床应用.
- 评估LLM诊断能力在专业领域,如耳鼻喉科是必不可少的.
- 之前的研究还没有全面比较耳鼻喉病例诊断领域领先的LLM.
研究的目的:
- 评估和比较三个著名的LLM的诊断准确性:聊天GPT-3.5,谷歌巴德和Bing-GPT4.
- 在标准化的一组耳鼻喉科临床图片上评估LLM绩效.
主要方法:
- 从"耳鼻喉病例 - 辛辛那提大学临床组合"中使用了100个临床细节.
- 每个图片都向ChatGPT-3.5,Google Bard和Bing-GPT4展示,并提示:"根据以下历史记录,提供诊断".
- 通过LLM提供的诊断与确定的正确诊断进行了准确性比较.
主要成果:
- 聊天GPT-3.5获得了最高的准确率89%,其次是谷歌巴德 (82%) 和Bing-GPT4 (74%).
- 在三个LLM (p=0.023) 之间,在诊断准确度方面观察到具有统计学意义的差异.
- 除了需要额外测试结果的细节外,ChatGPT-3.5的准确率上升至95.7%,Bard的准确率上升至88.17%,Bing-GPT4的准确率上升至78.72% (p=0.002).
结论:
- 与谷歌Bard和Bing-GPT4.5相比,ChatGPT-3.5对耳鼻喉科的视频显示出更高的诊断准确度.
- LLM显示出诊断常见耳鼻喉病的潜力,但需要详细的提示和临床医生的监督.
- 在临床实践中使用LLM时,从业人员必须保持警,以防潜在的AI"幻觉"和错误信息.


