大型语言模型在管理牙性鼻炎临床场景中的可靠性:初步的多学科评估
Alberto Maria Saibene1, Fabiana Allevi2, Christian Calvo-Henriquez3
1Otolaryngology Unit, Santi Paolo E Carlo Hospital, Department of Health Sciences, Università Degli Studi Di Milano, Milan, Italy. alberto.saibene@unimi.it.
概括
像ChatGPT这样的大型语言模型 (LLM) 在协助复杂的耳鼻喉病例的临床决策方面表现有前途,但较新的版本仍然与专家存在重大分歧. 随着人工智能的发展,需要进一步的研究.
科学领域:
- 耳鼻喉科 耳鼻喉科 耳鼻喉科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 牙性鼻炎 (ODS) 提出了复杂的多学科管理挑战.
- 大型语言模型 (LLM) 是新兴的工具,在医疗保健中具有潜在的应用.
研究的目的:
- 评估ChatGPT 3.5和4在管理复杂的耳鼻喉科临床场景中的实用性,特别是对于ODS.
- 在临床环境中比较不同LLM版本的性能.
主要方法:
- 五个与ODS相关的临床场景被用于评估.
- 一个由八名专家组成的多学科小组审查了LLM的答案.
- 计算了总分歧得分 (TDS),以量化LLM和专家之间的分歧.
主要成果:
- 与ChatGPT 3.5.5相比,ChatGPT 4显示出明显较低的不同意分数 (TDS).
- 最大的分歧发生在涉及轨道的复杂ODS病例中.
- 在评估者专业之间没有发现TDS的显著差异,尽管专家倾向于分配更高的分数.
结论:
- 在耳鼻喉科中,LLM显示有潜力补充基于证据的临床决策.
- 目前的LLM版本尚未成为直接临床管理的最佳方案,原因是与专家存在重大分歧.
- 持续评估不断发展的LLM绩效对于未来的临床整合至关重要.


