聊天GPT-4与耳鼻喉科医生的性能和一致性:临床案例系列
Jérôme R Lechien1,2,3,4, Mattheuw R Naunheim1,5, Antonino Maniaci1,6
1Research Committee of Young Otolaryngologists of the International Federation of Otorhinolaryngological Societies (IFOS), Paris, France.
概括
聊天机器人生成预训练型变压器-4 (ChatGPT-4) 显示出作为耳鼻喉科工具的前景,在初级诊断方面表现出色,但在治疗和检查选择方面表现不佳. 它在管理头部和部手术病例中的表现是一个关键发现.
科学领域:
- 耳鼻喉科-头部和部外科手术
- 人工智能在医学中的应用
- 医疗信息学 医疗信息学
背景情况:
- 像ChatGPT-4这样的先进AI工具在临床实践中的整合正在迅速发展.
- 评估AI在专业医疗领域的有效性对于采用至关重要.
- 耳鼻喉科提出了复杂的诊断和管理挑战,人工智能有可能帮助.
研究的目的:
- 评估ChatGPT-4在治疗耳鼻喉科-头手术病例中的性能.
- 将ChatGPT-4的诊断和管理建议与专家耳鼻喉科医生进行比较.
- 确定ChatGPT-4最有效的领域以及需要改进的领域.
主要方法:
- 一个潜在的病例系列,涉及100个来自多中心大学医院的成人耳鼻喉科门诊病例.
- 临床数据,包括病史和体检,被提交给ChatGPT-4以进行差异诊断,管理和治疗.
- 聊天GPT-4的反应被两个盲人,经过董事会认证的耳鼻喉科医生使用人工智能性能仪器来评估.
主要成果:
- 与人类从业者相比,ChatGPT-4建议每位患者进行更多的额外检查 (3.34对2.10).
- 在ChatGPT-4和耳鼻喉科医生之间观察到强烈的一致性,用于特定的诊断测试,如内镜和成像.
- 在初级诊断中,ChatGPT-4的准确性很高 (38%-86%),但对额外的检查 (8%-31%) 和治疗 (12%-44%) 的相关性较低.
结论:
- 聊天GPT-4展示了作为耳鼻喉科的辅助工具的潜力,特别是在生成全面的诊断信息方面.
- 人工智能在初级诊断方面比在推特定的额外检查或治疗计划方面更熟练.
- 人工智能算法需要进一步改进,以提高其在耳鼻喉科治疗和诊断测试选择中的实用性.


