五个免费的大型语言模型在牙创伤中的表现:一项为期30天的纵向基准研究
Rafaela Mancini Lisboa1, Arian Braido2, Adriana de-Jesus-Soares2
1Departament of Dentistry, Centro Universitário das Faculdades Associadas de Ensino - UNIFAE, São João da Boa Vista, Brazil.
Frontiers in oral health
|December 31, 2025
概括
微软Copilot和DeepSeek在回答牙科创伤问题方面表现出高准确性和一致性,优于其他大型语言模型 (LLM). 他们的表现在30天内保持稳定,背景提示没有显著影响.
科学领域:
- 医疗保健中的人工智能
- 牙科创伤学 牙科创伤学
- 医疗信息系统 医疗信息系统
背景情况:
- 大型语言模型 (LLM) 越来越多地用于医疗信息检索.
- 牙科创伤等专业领域的LLM的准确性和一致性需要严格的评估.
研究的目的:
- 为了比较五个领先的LLM在产生对牙科创伤的反应的准确性和一致性.
- 评估提示策略对该领域的LLM绩效的影响.
主要方法:
- 每天对五名LLM (ChatGPT,Google Gemini,微软 Copilot,DeepSeek,Meta AI) 提出60个关于牙创伤的真假问题,持续30天.
- 根据国际牙科创伤学会 (IADT) 的指导方针评估了反应,使用统计分析,包括灵敏度,特异性,精度和AUC.
- 时间稳定性通过类内相关系数 (ICC) 进行评估.
主要成果:
- 所有LLM都超过了85%的准确度;微软Copilot (91.1%) 和DeepSeek (90%) 显示了最高的性能,它们之间没有显著差异.
- 深度搜索和微软Copilot也表现出最高的时间一致性 (ICC>0.90).
- 背景提示并没有显著改变跨模型的准确性或稳定性.
结论:
- 微软的Copilot和DeepSeek显示了牙科创伤信息的高准确性和可靠性.
- 在牙科创伤中LLM的表现随着时间的推移而稳定,这表明临床支持的潜力.
- 进一步的研究可以探索LLM整合到牙科教育和患者信息资源.


