聊天GPT在牙科和过敏免疫学评估中的表现:一项比较研究
Alexander Fuchs1, Tina Trachsel2, Roland Weiger1
1Department of Periodontology, Endodontology, and Cariology, University Center for Dental Medicine Basel UZB, University of Basel, Basel, Switzerland.
Swiss dental journal
|October 6, 2023
概括
像ChatGPT这样的大型语言模型 (LLM) 在医疗保健方面表现有前途. 在牙科和免疫学考试中,初始化提高了LLM的表现,ChatGPT 4的表现通常优于ChatGPT 3.
科学领域:
- 人工智能在医学中的应用
- 在医疗保健中的自然语言处理.
背景情况:
- 大型语言模型 (LLM) 在包括牙科在内的各种医学领域展示了潜在的实用性.
- 用相关信息来启动LLM是一种提高其输出质量的策略.
研究的目的:
- 评估ChatGPT 3和ChatGPT 4在瑞士联邦牙科执照考试 (SFLEDM) 和欧洲过敏和临床免疫学考试 (EEAACI) 的自我评估问题上的表现.
- 评估启动对ChatGPT在这些医疗领域的表现的影响.
主要方法:
- 来自SFLEDM和EEAACI的多项选择题被运用到ChatGPT 3和ChatGPT 4中,无论是带有还是没有原始化.
- 通过对正确答案的准确度来衡量表现.
- 统计分析使用威尔科克森等级总和测试 (α=0.05).
主要成果:
- SFLEDM的平均准确率为63.3%,EEAACI的平均准确率为79.3%.
- 这两种ChatGPT版本在EEAACI上表现更好,而不是SFLEDM.
- 聊天GPT 4的表现始终优于聊天GPT 3.
- 在两个评估中,初始化显著改善了ChatGPT 3的表现 (EEAACI的p=0.017,SFLEDM的p=0.024).
- 启动显著改善了ChatGPT 4在SFLEDM评估中的表现 (p=0.038).
结论:
- 在医疗领域,ChatGPT表现出不同的熟练程度,可能是由于培训数据的差异.
- 启动是提高LLM性能的一种有效方法,特别是对于像ChatGPT 3这样的早期模型.
- 从ChatGPT 3到4的进步表明LLM技术的快速进展.
- 建议在医疗保健中谨慎应用LLM,因为其固有的局限性和风险.


