从精度到强度:对中国牙医执照考试中五种先进的大型语言模型进行比较研究
Jiarui Zhang1, Pascal Ubuzima1,2, Gaoyang Huang1
1College & Hospital of Stomatology, Anhui Medical University, Anhui Provincial Key Laboratory of Oral Diseases Research, Hefei, China.
BMC oral health
|December 22, 2025
概括
新的大型语言模型 (LLM) 在中国牙科执照考试 (CDLE) 中显示出高准确度,Gemini 2.5 Pro领先. 这些先进的AI工具显示出牙科教育和实践的潜力.
科学领域:
- 人工智能在牙科中的应用
- 医学教育中的自然语言处理.
背景情况:
- 大型语言模型 (LLM) 在包括牙科在内的各种领域显示出前景.
- 评估先进的LLM对于它们在牙科教育和实践中的应用至关重要.
研究的目的:
- 评估中国牙医执照考试 (CDLE) 的五个高级LLM的表现.
- 探索LLMs在牙科教育和临床实践中的潜力.
主要方法:
- 600个CDLE问题被用于测试DeepSeek-R1,GPT-4o,OpenAI o3,GPT-5思维和双子座2.5 Pro.
- 使用官方答案密钥评估准确性,并进行统计分析以进行性能比较.
- 对抗性测试评估了模型的抗扰强度.
主要成果:
- 双子 2.5 Pro 实现了最高的精度 (91.67%),显著超过了 GPT-4o.
- 牙科子学科的表现各不相同,GPT-4o落后.
- 所有经过测试的LLM都表现出对抗对抗干扰的稳定性,精度损失最小.
结论:
- 新一代LLM在CDLE上表现出很高的准确性,表明它们作为教育工具的潜力.
- 高级LLM显示出强大的稳定性,支持它们在牙科教育和实践中的使用.
- 法律学士学位可以作为牙科专业人员和学生的宝贵辅助工具.


