聊天GPT在牙科和过敏免疫学评估中的表现:一项比较研究
Alexander Fuchs1, Tina Trachsel2, Roland Weiger1
1Department of Periodontology, Endodontology and Cariology, University Center for Dental Medicine Basel UZB, University of Basel, Basel, Switzerland. florin.eggmann@unibas.ch.
Swiss dental journal
|May 10, 2024
概括
像ChatGPT这样的大型语言模型 (LLM) 在医疗保健方面表现有前途. 初始化改善了ChatGPT 3和4在牙科和免疫学考试中的表现,ChatGPT 4通常表现优于ChatGPT 3.
科学领域:
- 人工智能在医学中的应用
- 自然语言处理自然语言处理.
- 医疗教育 技术 技术 医学教育
背景情况:
- 大型语言模型 (LLM) 在包括牙科在内的医疗保健领域显示出潜在的实用性.
- 提供初始上下文的方法,可以提高LLM输出质量.
- 在标准化医疗检查中评估LLM的表现对于评估其为临床应用做好准备至关重要.
研究的目的:
- 评估ChatGPT 3和ChatGPT 4在瑞士联邦牙科执照考试 (SFLEDM) 和欧洲过敏和临床免疫学考试 (EEAACI) 的自我评估问题上的表现.
- 评估启动对这些医学领域ChatGPT响应准确性的影响.
主要方法:
- 来自SFLEDM和EEAACI的多选择题被管理到ChatGPT 3和ChatGPT 4.
- 测试进行了带有和没有原始化 (事先提供相关信息).
- 通过正确答案的百分比来衡量性能,并使用Wilcoxon等级总和测试进行统计分析.
主要成果:
- SFLEDM的平均准确率为63.3%,EEAACI的平均准确率为79.3%.
- 这两种ChatGPT版本在EEAACI上表现更好,而不是SFLEDM,ChatGPT 4的表现优于ChatGPT 3.
- 启动显著改善了ChatGPT 3在两个考试中的表现,以及ChatGPT 4在SFLEDM考试中的表现.
结论:
- 在医疗领域,ChatGPT表现出不同的熟练程度,可能是由于培训数据的差异.
- 启动是提高LLM性能的一种有效策略,特别是对于像ChatGPT 3这样的早期版本.
- 虽然法学士技术正在迅速发展,但由于固有的局限性和风险,在医疗保健中需要谨慎实施.


