基于深度学习的AI模型的准确性用于早期病变检测:注释质量和参考选择的影响
Ricardo E Gonzalez-Valenzuela1,2, Pascal Mettes3, Bruno G Loos4
1Department of Oral Radiology, Academic Centre for Dentistry Amsterdam (ACTA), University of Amsterdam and Vrije Universiteit Amsterdam, Gustav Mahlerlaan 3004 (Office 4N-73), Amsterdam, Noord-Holland, 1081 LA, the Netherlands. r.e.gonzalezvalenzuela@acta.nl.
Clinical oral investigations
|December 3, 2025
概括
评估人工智能 (AI) 模型用于早期虫检测需要仔细考虑参考标准. 这项研究突出了选择的评估方法如何显著影响被认为的AI性能,强调需要独立和临床相关的标准.
科学领域:
- 牙科诊断 牙科诊断 牙科诊断
- 医疗保健中的人工智能
- 医学成像分析分析 医学成像分析
背景情况:
- 人工智能 (AI) 工具用于 caries 检测越来越多地用于牙科.
- 人工智能模型的准确性对于可靠的临床决策至关重要.
- 不同的注释方法和评估标准可以影响人工智能模型的感知性能.
研究的目的:
- 评估各种注释方法对人工智能模型准确性对早期病变检测的影响.
- 调查不同的评估参考标准如何影响对AI模型结果的评估.
- 确定注释策略和评估标准对人工智能虫检测诊断准确性的影响.
主要方法:
- 在ACTA-DIRECT数据集上训练了多个AI损伤细分模型,使用不同的注释策略:单个牙医,聚合方法 (多数票,共识,STAPLE) 和基于微型CT的注释.
- 通过与基于微CT的注释和与培训匹配的注释进行比较来评估模型准确性.
- 使用McNemar测试来统计评估跨注释策略的诊断准确度差异.
主要成果:
- 在AI模型中,当与基于微型CT的注释进行评估时,没有观察到诊断准确性的统计学上显著差异.
- 人工智能模型的诊断准确性在与训练匹配的注释进行评估时,被发现在统计学上显著地更高.
- 培训期间的注释策略并没有显著影响人工智能准确性,但评估标准引入了偏见.
结论:
- 参考标准的选择显著影响AI模型在虫检测中的性能评估.
- 虽然培训注释方法的影响最小,但对不同标准的评估可能会导致有偏见的评估.
- 确保独立和临床相关的评估标准对于准确的AI性能评估,现实世界的采用和监管批准至关重要.

