GPT-4o与人类候选人:波兰牙科最终考试的绩效分析
Aleksander Jaworski1, Dawid Jasiński2, Barbara Sławińska3
1Department of Plastic Surgery, Specialist Medical Center, Polanica-Zdrój, POL.
Cureus
|October 7, 2024
概括
在波兰最终牙科考试 (LDEK) 中,OpenAI的GPT-4o取得了70.85%的准确率,显示出作为教育工具的潜力,但缺乏人类临床推理技能.
科学领域:
- 牙科 牙科是指牙科的专业.
- 人工智能的人工智能
- 医学教育 医学教育
背景情况:
- 波兰最终牙科考试 (LDEK) 对寻求执照的牙科毕业生至关重要.
- 人工智能 (AI) 越来越多地被整合到医学和牙科教育中.
- 在高风险的专业许可考试中评估AI能力是必不可少的.
研究的目的:
- 为了评估OpenAI的GPT-4o在LDEK上的性能.
- 将GPT-4o的结果与人类候选人的结果进行比较.
- 确定AI在牙科知识评估中的优缺点.
主要方法:
- 在2023年春季的LDEK考试 (200个多选题) 中测试了GPT-4o.
- 人工智能模型在没有访问公共问题库的情况下回答问题.
- 统计分析 (皮尔森奇方,曼-惠特尼U) 评估了准确度和信心水平.
主要成果:
- 在199个有效问题中,GPT-4o正确回答了141个 (70.85%).
- 精度因牙科学科而异,保守牙科和假牙牙科的表现更高,儿童牙科和正牙科的表现更低.
- 与事实问题 (72.87%) 相比,AI在基于临床案例的问题上 (36.36%) 的准确性明显较低.
结论:
- GPT-4o证明了作为牙科补充教育资源的潜力.
- 与人类牙医相比,AI在临床推理和判断方面表现出局限性.
- 虽然GPT-4o熟练地回忆事实,但尚未复制人类专业人员的批判性思维.


