大型语言模型在韩国牙医执照考试中的表现:比较研究
Woojun Kim1, Bong Chul Kim2, Han-Gyeol Yeom3
1The Robotics Institute, School of Computer Science, Carnegie Mellon University, Pittsburgh, Pennsylvania, USA.
International dental journal
|October 6, 2024
概括
大型语言模型 (LLM) 在牙科方面表现有前途,Claude3-Opus和ChatGPT-4通过了韩国牙科执照考试 (KDLE). 虽然这些人工智能模型尚未达到人类水平的性能,但它们在牙科教育和实践方面表现出强大的能力.
科学领域:
- 人工智能在牙科中的应用
- 牙科教育技术 牙科教育技术
- 大型语言模型 (LLM)
背景情况:
- 先进的人工智能的整合,特别是LLM,进入牙科等专业领域正在迅速发展.
- 与标准化考试对比LLM的能力评估对于评估其实际适用性至关重要.
研究的目的:
- 评估领先的LLM,包括ChatGPT和Claude3-Opus在韩国牙科执照考试 (KDLE) 的表现.
- 在严格的牙科资格背景下,将人工智能能力与人类表现进行基准测试.
主要方法:
- 三个LLM (GPT-3.5,GPT-4,Claude3-Opus) 使用KDLE问卷从2019-2023年进行测试.
- 将LLM成果与官方KDLE评分标准和人类 (牙科学生) 的表现进行了比较.
主要成果:
- 克劳德3-Opus和GPT-4 (ChatGPT-4) 通过了KDLE,在所有测试年中都超过了截止分数.
- GPT-3.5没有达到通过值.
- 虽然在特定科目中表现出色,但表现最好的LLM平均达到人类表现的85.4%.
结论:
- 像Claude3-Opus和ChatGPT-4这样的LLM在牙科应用中显示出巨大的潜力,超过了最低能力标准.
- 进一步整合LLM可以提高牙科教育和患者护理质量,只要它们符合既定的专业基准.


