用于内牙诊断的大型语言模型:与专家参考标准进行比较研究.
Vishal Kumar1, Navjot Singh Mann1, Kritika Sharma1
1Department of Conservative Dentistry and Endodontics, National Dental College and Hospital, Dera Bassi, Punjab, India.
概括
大型语言模型 (LLM) 在帮助牙科诊断方面表现有前途. 聊天GPT-5实现了完美的准确性,与专家内牙医相匹配,而Gemini和Perplexity也表现出强大的诊断能力.
科学领域:
- 牙周内科医院 牙周内科医院 牙周内科医院
- 人工智能在牙科中的应用
- 诊断的准确性 诊断的准确性
背景情况:
- 准确的内牙诊断在临床实践中至关重要,但具有挑战性.
- 人工智能 (AI),特别是大型语言模型 (LLM),正在成为潜在的临床支持工具.
研究的目的:
- 将三位领先的LLM (ChatGPT-5,Gemini,Perplexity) 的诊断性能与经验丰富的内牙医进行比较.
- 评估基于LLM的诊断支持在内牙科的准确性,敏感性和特异性.
主要方法:
- 一位经验丰富的内牙科医生评估了40个匿名的临床病例.
- 将ChatGPT-5,Gemini和Perplexity的诊断准确度与专家的判断进行了比较.
- 统计分析包括精度和科恩的卡帕系数 (κ).
主要成果:
- 聊天GPT-5与专家达成完全一致 (100%准确率, κ=1.00).
- 双子号显示了97.5%的准确性 (κ=0.95) 有一个假阳性.
- 困惑显示92.5%的准确性 (κ=0.85),缺少三个阳性病例,但保持了完全的特异性.
结论:
- 最先进的LLM可以在内牙科中实现专家级的诊断性能.
- 聊天GPT-5和双子星表现出优越的灵敏度,而聊天GPT-5和困惑表现出完全的特异性.
- 在广泛采用LLM用于内牙诊断之前,需要进一步验证.


