评估基于人工智能的大型语言模型对 Endodontic 根管治疗常见患者担忧的反应:比较性能分析
Busra Demir Cicek1, Orhan Cicek2
1Zonguldak Oral and Dental Health Center, Zonguldak Provincial Health Directorate, Zonguldak 67020, Türkiye.
Journal of clinical medicine
|November 13, 2025
概括
与GPT 5和Gemini 2.5 Flash相比,DeepSeek V3在回答根管治疗常见问题方面表现出卓越的准确性和全面性. 这些大型语言模型 (LLM) 显示出患者教育的潜力,但临床医生的监督至关重要.
科学领域:
- 医疗保健中的人工智能
- 医疗信息的自然语言处理.
- 牙科患者教育技术
背景情况:
- 大型语言模型 (LLM) 越来越多地被探索其在医疗保健信息传播方面的潜力.
- 患者对牙科手术的理解,如根管治疗,对于坚持和满意度至关重要.
- 评估LLM对患者查询的答案的准确性和全面性是必不可少的.
研究的目的:
- 为了比较DeepSeek V3,GPT 5和Gemini 2.5 Flash LLMs在响应根管治疗常见问题方面的表现.
- 评估LLM生成答案的准确性和全面性.
- 评估LLMs在提高患者教育和内牙科健康素养方面的潜在作用.
主要方法:
- 关于根管治疗的37个开放式常见问题 (FAQ) 来自知名来源.
- 来自DeepSeek V3,GPT 5和Gemini 2.5 Flash的响应被专家临床医生评估,使用5分利克特级来确定准确性和全面性.
- 统计分析包括Kruskal-Wallis H测试和Mann-Whitney U测试来比较模型性能,通过类内相关系数 (ICC) 评估inter-rater和测试-retest可靠性.
主要成果:
- 取得了优异的测试之间的可靠性 (ICCs 0.91-0.92) 和测试重复测试 (ICCs 0.89-0.90).
- 在准确度 (4.81) 和全面性 (4.78) (p < 0.05) 方面,DeepSeek V3显著超过了GPT 5和Gemini 2.5 Flash.
- 在GPT 5和Gemini 2.5闪光灯之间没有发现显著的性能差异,无论是准确性还是全面性.
结论:
- 像DeepSeek V3这样的LLM可以为牙科常见问题提供令人满意的答案,支持患者教育和健康素养.
- 专家临床医生的监督对于临床决策和治疗规划至关重要.
- 适当使用LLM可以提高患者对根管治疗的认识和满意度.


