生成型大语言人工智能模型的诊断准确性,用于评估牙拥挤情况
Khaled Wafaie1, Mohamed E Basyouni2,3, Tanmoy Bhattacharjee4
1Private Practice, Cairo, Egypt.
BMC oral health
|October 8, 2025
概括
与正牙医相比,生成人工智能 (AI) 模型在分类牙拥挤严重性的可靠性有限. 为了准确的牙图像分析,需要进一步的AI开发.
科学领域:
- 牙科成像 牙科成像
- 医疗保健中的人工智能
- 矯正牙科 矯正牙科是一種矯正牙科.
背景情况:
- 生成型人工智能模型显示出基于文本的牙科查询的前景.
- 他们的诊断和治疗规划能力需要彻底调查.
- 这项研究评估了AI在分类牙拥挤严重性的可靠性.
研究的目的:
- 评估生成AI模型在分类牙拥挤严重性的准确性.
- 为了比较ChatGPT-4o mini,微软Copilot和Claude 3.5 Sonnet的性能.
- 在牙科图像分析中评估AI模型的一致性和响应时间.
主要方法:
- 120张口腔内闭塞图像被牙科专家分为轻度,中度或重度拥挤.
- 三个人工智能模型 (ChatGPT-4o mini,Copilot,Claude 3.5 Sonnet) 分析了牙弧形识别和拥挤严重性的图像.
- 响应时间和分类准确性与正牙医的评估进行了比较;一致性被重新评估.
主要成果:
- 克劳德 3.5 索内特在分类拥挤严重程度方面实现了50%的准确性,ChatGPT-4o mini 44%,Copilot 34%的准确性.
- 对于Claude和ChatGPT-4o mini (99%),牙弧形的视觉识别很高,但对于Copilot (72%) 则较低.
- 聊天GPT-4o mini的响应时间明显更长;克劳德和副驾驶员的时间相似. 重复的分析显示了AI的改进,除了克劳德3.5小诗.
结论:
- 当前的生成人工智能模型 (ChatGPT-4o mini,Copilot,Claude 3.5 Sonnet) 在与专家正牙医相比,在分类牙拥挤严重程度方面表现有限.
- 在AI图像处理中取得重大进展是必要的,然后这些工具可以可靠地用于牙拥挤分类.
- 进一步的研究和开发对于将AI整合到正牙诊断和治疗规划中至关重要.


