在复杂的内牙病例情景中对大型语言模型的诊断预测和临床推理进行比较分析
Hrudi Sundar Sahoo1, A R Pradeep Kumar1, Archana Durvasulu1
1Department of Conservative Dentistry and Endodontics, Thai Moogambigai Dental College and Hospital, Dr. M.G.R. Educational and Research Institute, Golden George Nagar, Mogappair, Chennai, Tamil Nadu, India.
Journal of dentistry
|December 23, 2025
概括
四个大型语言模型 (LLM) 被评估为内牙诊断. 双子 2.0 闪光和克劳德 3.7 索内特显示出比 DeepSeek R1 更好的推理,但没有明显超过 GPT-4o.
科学领域:
- 人工智能在牙科中的应用
- 牙周内诊断诊断 牙周内诊断诊断
- 大型语言模型 (LLM)
背景情况:
- 先进AI的诊断准确性和临床推理,特别是大型语言模型 (LLM),在复杂的内牙病例中仍然在很大程度上未被探索.
- 评估LLM的能力对于他们可能融入牙科实践至关重要.
研究的目的:
- 为了比较四个最先进的LLM的诊断预测准确性和临床推理:GPT-4o,克劳德3.7索内特,DeepSeek R1和双子座2.0闪光.
- 通过结构化提示来评估LLM在分析复杂的内牙病例中的表现.
主要方法:
- 九个复杂的内牙病例报告被匿名化并转换为标准化的叙述.
- 每个LLM都产生了三个贝叶斯排名的诊断可能性与理由.
- 牙内科医生专家评估了LLM的临床可信性,放射性证明和术语准确性的结果.
主要成果:
- 双子 2.0 闪光和克劳德 3.7 索内特显示出比 DeepSeek R1.1 更高的解释性推理质量.
- 双子座2.0闪光,克劳德3.7索内特和GPT-4o之间的性能差异在统计学上并不显著.
- 与克劳德3.7索内特和双子座2.0闪光相比,DeepSeek R1的性能显著下降.
结论:
- 当代LLM对内牙诊断的解释性推理性能存在显著差异.
- 克劳德3.7索内特和双子座2.0闪光灯的性能优于DeepSeek R1,这表明模型特定的性能差异.
- 模型选择和结构化提示对于可靠的人工智能辅助内牙诊断至关重要,需要专门的培训和人类监督.


