在口腔和面外科手术检查中使用大型语言模型的性能
B Quah1, C W Yong1, C W M Lai2
1Faculty of Dentistry, National University of Singapore, Singapore; Discipline of Oral and Maxillofacial Surgery, National University Centre for Oral Health, Singapore.
International journal of oral and maxillofacial surgery
|June 26, 2024
概括
大型语言模型 (LLM) 显示出口腔和口外科教育的潜力,在多选题中平均得分为62.5%. GPT-4带来了性能,但需要进一步验证临床使用.
科学领域:
- 医学教育 医学教育
- 在外科手术中使用人工智能
- 口腔和牙面部外科手术
背景情况:
- 人工智能 (AI) 在医学教育中的整合正在迅速扩大.
- 在专门的外科领域评估大型语言模型 (LLM) 的功能对于理解它们的潜在应用至关重要.
- 口腔和面外科手术 (OMS) 需要在各种医学和牙科科学中建立坚实的基础.
研究的目的:
- 评估各种LLM在口腔和面外科领域的多选择题答案的准确性.
- 为了比较不同LLM的性能,包括GPT-3.5,GPT-4,Llama 2,Gemini和Copilot,在一个标准化的WHO问题库上.
- 识别WHO知识领域的LLM的优势和弱点.
主要方法:
- 使用了来自世界卫生组织大学问卷库的259个选择题.
- 五个不同的LLM (GPT-3.5,GPT-4,Llama 2,Gemini和Copilot) 被雇用来回答选定的问题.
- 通过计算整体得分和特定OMS类别内的得分来评估绩效,其中50%的合格门.
主要成果:
- 所有LLM的平均整体准确率为62.5%.
- 在GPT-4中,表现最高的是76.8%,其次是Copilot (72.6%),GPT-3.5 (62.2%),Gemini (58.7%) 和Llama 2 (42.5%).
- 在"基础科学" (68.9%) 和"药理学" (45.9%) 中,LLM的表现最好,整体表现有统计学上显著的差异.
结论:
- 作为口腔和面外科教育的补充工具,LLM表现有前途.
- 目前的LLM准确性表明,在没有进一步开发和验证的情况下,不应该依赖于临床决策.
- 跨LLM和知识领域的性能差异凸显了在外科教育中对AI的持续研究和改进的需要.


