在大型语言模型中对耳鼻喉学知识的比较评估
Dante J Merlino1, Santiago R Brufau1, George Saieed1
1Department of Otolaryngology-Head and Neck Surgery, Mayo Clinic, Rochester, Minnesota, U.S.A.
The Laryngoscope
|September 21, 2024
概括
与其他大型语言模型相比,OpenAI的GPT-4在回答耳鼻喉科问题方面表现出卓越的表现. 促进推理提高了所有评估模型的准确性,突出了AI在医学教育中的潜力.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 耳鼻喉科-头部和部外科手术
背景情况:
- 大型语言模型 (LLM) 正在越来越多地探索其在医疗应用中的潜力.
- 评估专业医学知识的LLM绩效对于理解其实用性至关重要.
研究的目的:
- 评估先进的大型语言模型 (OpenAI的GPT-3.5和GPT-4,谷歌的PaLM2和MedPaLM,Meta的Llama3:70b) 在耳鼻喉学临床测试问题上的准确性.
主要方法:
- 使用了4566个耳鼻喉科多选题的数据集.
- 每个LLM都收到了一个标准化的提示,然后是一个问题.
- 分析了所有模型错误回答的100个问题,以寻找错误模式.
主要成果:
- GPT-4获得了最高的精度 (77.1%),其次是MedPaLM (70.6%),Llama3:70b (66.8%),GPT-3.5 (58.5%) 和PaLM2 (56.5%).
- 提供推理促使所有模型的准确性提高,GPT-4显示出最显著的改善 (31%的错误答案得到纠正).
结论:
- 在了解耳鼻喉科的临床知识方面,LLM 具有不同的能力.
- GPT-4表现出对耳鼻喉学概念的强烈掌握,使其成为头部和部外科教育的有希望的工具,并采取适当的谨慎措施.


