创伤性牙损伤知识七大语言模型的比较基准
Kittipat Termteerapornpimol1, Sirinya Kulvitit2, Sasiprapa Prommanee3
1Department of Occlusion, Faculty of Dentistry, Chulalongkorn University, Bangkok, Thailand.
European journal of dentistry
|October 22, 2025
概括
DeepSeek R1在回答创伤性牙损伤 (TDI) 问题方面表现最准确,超过其他大型语言模型 (LLM). 然而,人工智能工具在复杂的病例中表现出局限性,例如光,应该补充,而不是取代临床专业知识.
科学领域:
- 人工智能在牙科中的应用
- 牙科创伤学 牙科创伤学
- 大型语言模型 (LLM)
背景情况:
- 创伤性牙损伤 (TDI) 需要精确的临床决策.
- 大型语言模型 (LLM) 显示了支持牙科管理的潜力.
- 在TDI中评估LLM的表现对于理解AI的作用至关重要.
研究的目的:
- 评估DeepSeek R1在TDI类别中的准确性和一致性.
- 将DeepSeek R1与其他领先的TDI管理LLM进行基准测试.
- 确定AI在牙科创伤临床支持方面的优势和局限性.
主要方法:
- 七个LLM,包括DeepSeek R1,使用125项验证的TDI问题集进行了评估.
- 问题涵盖了一般介绍,骨折,脱落,脱落和初级牙TDI.
- 每个LLM都经历了每项5次重复,准确度和Fleiss' kappa的一致性计算.
主要成果:
- 深度搜索R1获得了最高的准确度 (86.4%±2.5%),超过了ChatGPT-4o mini,Claude 3 Opus和Gemini 1.5闪光灯 (p < 0.0001).
- 在所有模型中,DeepSeek R1表现出最低的一致性 (κ = 0.694).
- 所有模型都显示出对位损伤问题的准确性较低 (68.3%±3.2%).
结论:
- 对于TDI来说,LLM提供中等到高精度,但在一致性方面有所不同.
- 复杂的案例,如光,揭示了当前AI诊断推理的局限性.
- 人工智能是牙科教育和知识获取的有价值的辅助工具,而不是临床判断的替代品.


