解码智慧:评估ChatGPT的准确性和可重现性,用于分析第三关节评估的骨折图像
Ana Suárez1, Stefania Arena1, Alberto Herranz Calzada1,2
1Department of Pre-Clinic Dentistry II, Faculty of Biomedical and Health Sciences, Universidad Europea de Madrid, Calle Tajo s/n, Villaviciosa de Odón, Madrid 28670, Spain.
Computational and structural biotechnology journal
|April 24, 2025
概括
聊天GPT-4o在解释牙科放射图像方面显示出有限的准确性,就像orthopantomograms (OPGs). 虽然一致,但其当前的局限性需要专业监督,以便在人工智能辅助牙科中安全地进行临床整合.
科学领域:
- 医疗保健中的人工智能
- 牙科放射学 牙科放射学
- 临床决策支持系统 临床决策支持系统
背景情况:
- 人工智能 (AI) 集成为放射学中的临床决策支持提供了潜力.
- 对特定的诊断任务评估像ChatGPT-4o这样的AI工具对于安全实施至关重要.
研究的目的:
- 评估ChatGPT-4o的准确性和可重现性,用于解释骨科影像 (OPG).
- 评估ChatGPT-4o在模拟患者要求下第三牙提取评估方面的表现.
主要方法:
- 通过向ChatGPT-4o提交的标准提示,分析了30个OPG,产生了900个响应.
- 口腔外科专家使用三点利克特级别来评估反应;分歧由第三位专家解决.
- 计算了准确性和可重复性指标,包括Gwet的系数.
主要成果:
- 在OPG解释中,ChatGPT-4o实现了38.44%的整体准确率.
- 在重复中响应一致度为82.7%,但Gwet的系数表明中度的重复性 (60.4%).
- 该模型经常提供不完整或伪造的信息,特别是在复杂的案件中.
结论:
- 目前ChatGPT-4o的准确性和可靠性不足以在牙科放射学中进行无监督的临床使用.
- 专业监督对于减轻与AI解释相关的诊断错误至关重要.
- 为了安全地融入牙科实践,需要进一步改进人工智能模型和专业培训.


