基于人工智能的大型语言模型在制定正治疗计划中的可靠性评估
Makara Sorel1, Chaitanya Gurrala2, Aditya Tadinada1
1Oral and Maxillofacial Radiology, University of Connecticut (UConn) School of Dental Medicine, Farmington, USA.
Cureus
|September 2, 2025
概括
人工智能 (AI) 大型语言模型 (LLM) 显示为牙科治疗计划的前景. 与双子座2. 0闪光实验相比,ChatGPT-4o的临床准确性和共识更高.
科学领域:
- 牙整形
- 人工智能
- 临床决策支持
背景情况:
- ортодонтическое治疗计划整合了复杂的牙,骨和软组织数据.
- 临床专业知识和基于证据的指导方针传统上为治疗决策提供了信息.
- 人工智能的进步,特别是大型语言模型 (LLM),为改善临床工作流程提供了快速评估.
研究的目的:
- 评估基于人工智能的LLM (ChatGPT-4o和Gemini 2.0闪光实验) 在制造牙科治疗计划方面的能力.
- 根据临床病例数据,比较不同LLM在制定详细和全面的治疗策略方面的有效性.
主要方法:
- 已发表的十篇正病例报告被总结为标准化的临床输入.
- 这些输入被输入到ChatGPT-4o和Gemini 2.0 Flash Experimental中以生成治疗计划.
- 由牙科专家和牙科专家独立评估结果的准确性,完整性和相关性.
主要成果:
- ChatGPT-4o获得了更高的临床一致性和评估者共识 (克里多夫α=0. 935).
- 双子 2.0 闪光实验显示出更大的可变性和中等一致性 (克里多夫α = 0.692).
- 与双子相比,ChatGPT-4o包含了更多相关的临床细节,并且与基于证据的标准更好地保持一致.
结论:
- 像ChatGPT-4o和Gemini 2.0 Flash Experimental这样的LLM可以在正治疗计划中发挥重要作用.
- 这些人工智能工具显示出潜力,特别是在例行病例中,但并不能取代临床专业知识的需求.
- 需要进一步的研究来探索人工智能的全部能力和局限性.


