人工智能在回答多项选择口腔病理学问题的表现:比较分析
Birkan Eyup Yilmaz1, Busra Nur Gokkurt Yilmaz2, Furkan Ozbey3
1Faculty of Dentistry, Department of Oral and Maxillofacial Surgery, Giresun University, Giresun, Türkiye. ylmzbirkan@gmail.com.
BMC oral health
|April 15, 2025
概括
与其他大型语言模型 (LLM) 相比,ChatGPT o1在回答口腔病理问题的准确度更高. 这项研究强调了LLMs作为牙科培训中的教育工具的潜力,尽管需要进一步验证.
科学领域:
- 人工智能在牙科中的应用
- 口腔病理学教育教育 口腔病理学教育
- 大型语言模型 (LLM)
背景情况:
- 人工智能 (AI) 越来越多地融入医疗保健和牙科教育.
- 人工智能影响诊断过程,治疗计划和学术培训.
- 本研究评估了口腔病理学中的大型语言模型 (LLM).
研究的目的:
- 评估和比较各种法学士的表现.
- 分析回答多项选择口腔病理学问题的准确率.
- 根据问题类型 (基于案例与基于知识) 识别LLM绩效的差异.
主要方法:
- 八个LLM被评估使用100个多选口腔病理学问题从土耳其牙科专业化考试 (2012-2021).
- 问题被分类为基于案例或基于知识的.
- 与官方答案密钥相比,答案被评为正确或不正确,没有提供反以防止偏见.
主要成果:
- 在LLM中观察到显著的性能差异 (p < 0.001).
- 聊天GPT o1获得了最高的准确性 (96%),其次是Claude 3.5 (84%),Gemini 2和Deepseek (82%).
- 在基于案例的问题上,ChatGPT o1和Claude表现出色,而在基于知识的问题上,ChatGPT o1和Deepseek领先.
结论:
- 在口腔病理学方面,LLM表现出可变的熟练程度,ChatGPT o1表现出卓越的准确性.
- 在牙科培训中,LLM显示出作为补充教育资源的前景.
- 需要进一步的研究和验证,以确认LLMs在这个领域的实用性.


