使用不同的人工智能驱动工具评估多选题的准确性 - - 一项观察性研究
1Assistant Professor, Department of Oral and Maxillofacial Surgery and Diagnostic Sciences, Division of Diagnostic Sciences, College of Dentistry, Jazan University, Jazan, . P O code: 82848, KSA.
Dento maxillo facial radiology
|December 6, 2025
概括
微软Co-pilot和ChatGPT-4o在回答口腔放射学多选择题 (MCQ) 中表现出最高的准确性. 这项研究揭示了显著的人工智能性能差异,为牙科教育提供了对人工智能聊天机器人的见解.
科学领域:
- 人工智能在牙科中的应用
- 口腔放射学教育 在口腔放射学教育.
- 医疗教育 技术 技术 医学教育
背景情况:
- 人工智能 (AI) 工具越来越多地被整合到医学教育中.
- 在特定领域的知识测试中评估AI的准确性和效率至关重要.
- 口腔放射学教育需要精确可靠的评估工具.
研究的目的:
- 评估各种AI聊天机器人的准确性和响应时间.
- 为了比较人工智能在口腔放射学多选题 (MCQ) 的表现.
- 确定人工智能工具对牙科教育的适用性.
主要方法:
- 在5个领域使用了80个口腔放射学MCQ.
- 评估了ChatGPT,ChatGPT-4o,微软Co-pilot,DeepSeek,Gemini和Meta AI的准确性和响应时间.
- 千平方测试和单向ANOVA用于统计分析.
主要成果:
- 微软的副驾驶和ChatGPT-4o显示了最高的整体准确性.
- 聊天GPT提供了最快的响应时间.
- 微软 Co-pilot 在基于知识的问题和放射性安全性 (100%的准确性) 中表现出色; DeepSeek 在放射性诊断方面优越.
结论:
- 微软 Co-pilot 在基于知识和放射性安全问题上表现出卓越的整体准确性和性能.
- 聊天GPT-4o是第二个最准确的,而DeepSeek在放射性诊断方面表现强.
- 人工智能聊天机器人表现出性能变化,影响了它们在牙科教育中的实用性.


