大语言人工智能模型在解决修复牙科和内牙科学生评估中的表现
Paul Künzle1, Sebastian Paris2
1Department of Operative, Preventive and Pediatric Dentistry, Charité - Universitätsmedizin Berlin, Aßmannshauser Str. 4-6, Berlin, 14197, Germany. paul.kuenzle@charite.de.
Clinical oral investigations
|October 7, 2024
概括
人工智能 (AI) 和大型语言模型应用 (LLMA) 在修复牙科和内牙科问题上表现不同. 聊天GPT-4模型为牙科教育提供谨慎的支持,表现优于其他.
科学领域:
- 牙科教育 牙科教育
- 人工智能在牙科中的应用
- 恢复性牙科和内脏牙科.
背景情况:
- 人工智能 (AI) 和大型语言模型应用程序 (LLMA) 正在迅速发展,具有重大社会影响.
- 在牙科等专业学术领域应用LLMA需要严格的绩效评估.
研究的目的:
- 分析各种LLMA在回答修复牙科和内牙科 (RDE) 内的学生评估问题方面的表现.
- 在专业的牙科环境中比较不同AI模型的准确性和有效性.
主要方法:
- 使用151个多项选择RDE问题来提示OpenAI的ChatGPT (3.5,4.0,4.0o) 和谷歌的Gemini 1.0.0.
- 问题被分为四个子类别:直接修复,,间接修复和内牙科.
- 使用Python进行了统计分析,包括p值和chi平方测试.
主要成果:
- 聊天GPT-4.0o显示了最高的准确性 (72%),其次是聊天GPT-4.0 (62%),双子座1.0 (44%) 和聊天GPT-3.5 (25%).
- 在所有测试的LLMA中观察到显著的绩效差异,GPT-4.0模型之间有显著的例外.
- 在直接修复和虫子类别中获得了最高的准确性.
结论:
- 当前的LLMA在RDE评估问题上存在显著的绩效差异.
- 只有ChatGPT-4模型显示出可以谨慎地融入牙科学术课程的潜力.
- 对于牙科专业人员来说,LLMA的实用性在很大程度上取决于所使用的特定AI模型,ChatGPT-4.0o在某些领域显示了可接受的准确性.


