在正统牙科知识评估中,四大语言模型的可靠性和性能
Shankargouda Patil1, Gabriel Eisenhuth1, Tarek El-Bialy2
1College of Dental Medicine, Roseman University of Health Sciences, South Jordan, Utah, USA.
Journal of dental education
|July 27, 2025
概括
这项研究评估了人工智能 (AI) 大语言模型 (LLM) 对于正牙教育. 虽然微软CoPilot显示出可靠性和ChatGPT-4.0准确性,但AI响应在独立使用时仍然不一致.
科学领域:
- 牙科教育 牙科教育
- 人工智能在医学中的应用
背景情况:
- 大型语言模型 (LLM) 越来越多地被用作教育资源.
- 评估AI在牙科等专业领域的表现至关重要.
研究的目的:
- 评估在回答 ортодонтика委员会考试问题时流行的LLMs的准确性和可靠性.
- 在多个试验中确定AI反应的一致性.
主要方法:
- 四个LLM (ChatGPT 4.0,ChatGPT 4o,谷歌双子座,微软CoPilot) 进行了测试.
- 来自国家牙科检查师委员会考试的正统牙科问题被使用.
- 在三个试验中评估了响应的一致性,使用Cohen和Fleiss的Kappa分析了可靠性.
主要成果:
- 微软CoPilot显示出最高的可靠性,而ChatGPT-4.0显示出最高的准确性.
- 试验中响应的显著变化表明AI不一致.
- 旧的AI模型有时会超过新版本的性能,更新也不能保证可靠性提高.
结论:
- 目前的LLM表现不一致,限制了它们在正牙教育中作为独立工具的使用.
- 人工智能模型显示出作为补充学习辅助工具的潜力,但对于教育部署需要进一步改进.


