定制的GPT-4V (视觉) 用于放射性诊断:大语言模型能检测到多余的牙吗?
Enes Mustafa Aşar1, İrem İpek2, Kübra Bi Lge3
1Department of Pediatric Dentistry, Faculty of Dentistry, Selçuk University, Konya, Turkey. enesmustafasar@gmail.com.
BMC oral health
|May 21, 2025
概括
一个定制的GPT-4V模型 (CGPT-4V) 在牙科放射图上检测超数牙的准确率达到了91%,超过了标准GPT-4o和GPT-4V模型. 特定领域的培训显著提高了AI在放射学中的诊断性能.
科学领域:
- 放射学中的人工智能
- 牙科诊断 牙科诊断 牙科诊断
- 医学成像分析 医学成像分析
背景情况:
- 人工智能语言模型 (例如,ChatGPT) 在处理文本和图像方面的能力不断增长.
- 需要评估人工智能的准确性,以检测周围牙X射线图上的多数牙.
- 开发一个定制的GPT-4V模型 (CGPT-4V) 用于特定领域的培训.
研究的目的:
- 评估标准GPT-4V,GPT-4o和定制GPT-4V (CGPT-4V) 模型的诊断准确性,以检测多数牙.
- 确定特定领域的培训是否可以提高牙科放射学中的AI诊断性能.
- 为了比较不同的人工智能模型在周围放射图上的性能.
主要方法:
- 使用GPT-4V,GPT-4o和CGPT-4V.对180张周周放射图 (90张带有90张和90张没有超数牙) 的评估.
- 标准化提示符用于每个图像,以避免上下文偏差.
- 通过使用利克特和二进制尺度对答案进行专家评分,并进行统计分析 (Chi-square,ROC) 以进行性能比较 (p < 0.05).
主要成果:
- CGPT-4V显示了最高的准确性 (91%),其次是GPT-4o (77%) 和GPT-4V (63%).
- 与GPT-4V (42%) 相比,CGPT-4V的虚假阳性率明显较低 (16%).
- 在CGPT-4V和GPT-4o之间发现了统计学上显著的性能差异 (p < 0.001).
结论:
- 定制的GPT模型在牙科放射学中显示出显著的诊断潜力.
- 特定领域的培训可以提高人工智能的准确性,用于检测超数的牙.
- 未来的研究应该专注于临床整合,多中心验证和成本效益.


