在土耳其牙科专业化考试中,对儿科牙科问题的大型语言模型的性能比较
Hatice Kübra Başkan1, Beyhan Başkan2
1Department of Pediatric Dentistry, Faculty of Dentistry, Kahramanmaras Sutcu Imam University, Onikisubat, Kahramanmaras, Türkiye. kubrabaskan@ksu.edu.tr.
BMC medical education
|December 30, 2025
概括
与其他大型语言模型 (LLM) 相比,Gemini 2.5 Pro在儿科牙科考试问题上表现优异. 虽然LLM可以帮助牙科教育,但它们还不能用于临床决策.
科学领域:
- 人工智能的人工智能
- 自然语言处理自然语言处理.
- 牙科教育 牙科教育
背景情况:
- 大型语言模型 (LLM) 在各种专业领域越来越多地使用.
- 它们在牙科等专业医学教育中的应用需要仔细评估.
- 评估高风险考试的LLM绩效对于理解其实用性至关重要.
研究的目的:
- 为了比较七个领先的LLM在土耳其牙科专业考试 (DUS) 的儿科牙科问题上的表现.
- 为了区分基于信息和基于案例的问题类型之间的LLM绩效.
- 为了确定牙科教育支持中最有效的LLM.
主要方法:
- 七个LLM (Gemini 2.5 Pro,Grok-4,GPT-5,Claude-4,Copilot,Perplexity,GPT-4o) 进行了测试.这些LLM的使用情况包括:
- 使用了来自DUS儿科牙科考试 (2012-2021) 的127个多选题.
- 问题被分为基于信息 (96) 或基于案例 (31) 的类别,并对准确性进行评估.
主要成果:
- 在LLM中发现了精度的显著差异 (p < 0.001).
- 双子 2.5 Pro 实现了最高的整体精度 (94.5%),超过了包括 GPT-4o (63.0%) 在内的其他产品.
- 双子座在基于信息 (95.8%) 和基于案例 (90.3%) 的问题上都表现出色,而GPT-4o和Perplexity在基于案例的问题上表现不佳.
结论:
- 在信息检索和考试准备方面,LLM可以作为牙科学生的宝贵"副驾驶员".
- 目前的LLM在临床诊断和治疗决策方面不可靠.
- 未来的LLM开发应侧重于多式联络能力,以提高临床适用性.


