临床决策中的AI:ChatGPT-4与耳鼻喉病例的Llama2对比
Antonino Maniaci1,2,3,4, Cosima C Hoch5,6, Lise Sogalow5,7
1Department of Medical and Surgical Sciences, Faculty of Medicine, University of Enna Kore, Enna, Italy. Antonino.maniaci@unikore.it.
概括
聊天GPT-4和Llama2作为耳鼻喉科决策支持工具显示出希望,ChatGPT-4显示出卓越的诊断准确性和治疗建议. 人类监督对于安全的临床应用至关重要.
科学领域:
- 耳鼻喉科 耳鼻喉科 耳鼻喉科
- 人工智能的人工智能
- 医学诊断 医学诊断 医学诊断
背景情况:
- 人工智能 (AI) 越来越多地被用于临床决策支持.
- 像ChatGPT-4和Llama2这样的大型语言模型 (LLM) 在医疗应用中具有潜力.
研究的目的:
- 为了评估ChatGPT-4和Llama2.2的诊断准确度.
- 通过这些人工智能模型评估额外审查建议的适当性.
- 为了比较ChatGPT-4和Llama2为耳鼻喉病例建议的治疗方案的一致性.
主要方法:
- 一项前性研究分析了98个匿名耳鼻喉病例.
- 临床数据被输入到ChatGPT-4和Llama2以进行诊断,检查和治疗建议.
- 两个耳鼻喉科医生使用AIPI评估AI输出,评估准确性,适当性和充分性.
主要成果:
- 聊天GPT-4的诊断准确率达到了82%,超过了Llama2的76%.
- 在88%的病例中,ChatGPT-4建议进行适当的额外检查,而Llama2.2的情况为83%.
- 对ChatGPT-4的治疗适当性为80%,对Llama2的治疗适当性为72%,这两种系统偶尔都会建议进行不适当的测试.
结论:
- 聊天GPT-4和Llama2显示出作为耳鼻喉科临床决策支持工具的巨大潜力.
- 在诊断准确性,检查建议和治疗计划方面,ChatGPT-4表现出卓越的性能.
- 为了确保这些人工智能工具的安全有效的临床整合,需要进一步的改进和人类监督.


