聊天生成预训练变压器-4.0在评估椎和手腕成熟阶段的准确性:一项回顾性研究
Meryem Akpınar1, Farhad Salmanpour1
1Department of Orthodontics, Afyonkarahisar Health Sciences University, Afyonkarahisar, Turkey.
概括
评估了ChatGPT-4.0对椎和手腕成熟的诊断准确性. 虽然在某些阶段 (RU,CVS1) 准确,但其整体性能低于其他AI模型.
科学领域:
- 矯正牙科 矯正牙科是一種矯正牙科.
- 人工智能在医学中的应用
- 放射学分析 放射学分析
背景情况:
- 椎成熟和手腕成熟对于正牙治疗计划至关重要.
- 精确的骨成熟阶段测定有助于预测生长和优化治疗时间.
- 评估人工智能工具用于诊断正确性在牙正科是一个新兴的研究领域.
研究的目的:
- 评估ChatGPT-4.0在确定椎脊椎成熟阶段 (CVS) 和手腕成熟阶段的诊断准确性.
- 将ChatGPT-4.0的性能与经验丰富的正牙医建立的参考标准进行比较.
- 为了确定ChatGPT-4.0表现出高或低诊断性能的特定阶段.
主要方法:
- 对238名被试进行了回顾性分析,同时进行了脑电测量和手腕X射线.
- 由3名正牙医 (Björk和Helm方法) 进行手腕成熟的独立评估.
- 3位正牙医对椎成熟阶段的评估 (Bacetti方法) 作为参考标准.
- 通过ChatGPT-4.0对放射图片进行分析,并由主要研究人员记录结果.
主要成果:
- 在手腕成熟的RU阶段,ChatGPT-4.0实现了高性能 (AUC=0.89).
- 该模型显示了手腕成熟阶段的可变精度和回忆 (例如PP3U,MP3U中的低回忆).
- 对于椎成熟阶段,ChatGPT-4.0在CVS1中表现最好 (AUC=0.82),但在CVS3和CVS6中表现不佳 (AUC<0.67).
结论:
- 聊天GPT-4.0证明了对特定阶段的准确预测,包括手腕RU和椎脊椎CVS1.
- 发现,与其他人工智能模型相比,ChatGPT-4.0的整体诊断性能较差.
- 需要进一步的研究来提高人工智能模型的准确性,以便在正中全面评估骨成熟度.


