基于德米尔吉安的方法,评估生成人工智能模型在牙年龄估计中的准确性
Allan Abuabara1, Thais Vilalba Paniagua Machado do Nascimento2, Seandra Maria Trentini1
1Post-Graduation Program in Health and Environment, University from the Joinville Region - Univille, Joinville, Brazil.
Frontiers in dental medicine
|August 13, 2025
概括
像ChatGPT,Gemini和DeepSeek这样的生成人工智能模型显示了使用Demirjian估计牙年龄的潜力.
科学领域:
- 法医牙科 法医牙科
- 儿科牙科 儿科牙科
- 医疗保健中的人工智能
背景情况:
- 牙科年龄估计对于法医识别,临床诊断和治疗计划至关重要.
- 大型语言模型 (LLM) 正在成为各种牙科应用中的潜在工具.
- 德米尔吉安的方法为评估牙发育阶段提供了一种标准化的方法.
研究的目的:
- 评估和比较生成人工智能 (AI) 大语言模型 (LLM) 在估计牙年龄方面的性能.
- 根据Demirjian的基于全景放射图的发育评分系统来评估LLM的准确性.
- 为了比较ChatGPT (GPT-4-turbo),Gemini 2.0 Flash和DeepSeek-V3对牙科年龄估计的疗效.
主要方法:
- 使用德米尔吉安的方法分析了30名个体 (平均年龄10.4岁) 的全景放射图.
- 没有经过培训的LLM (ChatGPT,Gemini,DeepSeek) 根据提供的Demirjian分数估计了牙年龄.
- 模型性能使用平均绝对误差 (MAE),根平均平方误差 (RMSE),R平方 (R2) 和偏差来量化,可靠性通过类内相关系数 (ICC) 来评估.
主要成果:
- 内部和内部检查员的可靠性 (ICC) 超过0.85.
- 聊天GPT和DeepSeek的表现低于最佳,MAE为1.98-2.05年,R2值为负,估值偏差明显高.
- 双子座显示中期结果,其中MAE为中度 (1.57年),RMSE为1.81年),R2为阳性 (0.367年) 和偏差较低 (1.32年).
结论:
- 目前的生成AILLM可以估计牙年龄,但性能低于传统方法.
- 在测试的模型中,DeepSeek-V3表现出了最佳的性能,尽管仍然需要改进.
- 在临床实施这些人工智能模型用于牙年龄估计之前,对特定任务的培训和验证至关重要.


