基于图像的诊断表现的LLMsvsCNNs口腔平:以示例为指导和差异诊断
Paak Rewthamrongsris1, Jirayu Burapacheep2, Ekarat Phattarataratip3
1Center of Artificial Intelligence and Innovation (CAII) and Center of Excellence for Dental Stem Cell Biology, Faculty of Dentistry, Chulalongkorn University, Bangkok, Thailand; Department of Conservative Dentistry and Periodontology, LMU University Hospital, LMU Munich, Germany.
International dental journal
|June 7, 2025
概括
大型语言模型 (LLM) 显示出从图像中诊断口腔平坦 (OLP) 的潜力,但目前的模型尚未在临床上可行. 与LLMs相比,卷积神经网络 (CNNs) 在OLP检测方面表现优异.
科学领域:
- 人工智能在医学中的应用
- 口腔病理学 口腔病理学
- 医学成像分析 医学成像分析
背景情况:
- 口腔平坦 (OLP) 由于其与其他口腔病变重叠的特征,提出了诊断挑战.
- 具有计算机视觉功能的大型语言模型 (LLM) 提供了一个潜在的替代诊断工具.
- 评估用于检测OLP和生成差异诊断的LLM对于提高诊断准确性至关重要.
研究的目的:
- 评估七种LLM (专有和开源) 在从口腔内图像中检测口腔平坦 (OLP) 的诊断性能.
- 为了比较LLMs在零射击识别,示例引导识别和对OLP的差异诊断生成中的有效性.
- 为了将LLM性能与OLP检测的既定卷积神经网络 (CNN) 模型进行比较.
主要方法:
- 使用了1142张OLP,非OLP病变和正常粘膜的临床照片的数据集.
- 使用零射击,示例指导和差异诊断实验设计来评估LLM.
- 性能指标包括准确性,精度,回忆,F1分数和折扣累积收益 (DCG);LLM与CNN模型在110张图像的子集上进行了比较.
主要成果:
- 双子1.5 Pro/Flash在零射击中获得了最高准确率 (69.69%),而GPT-4o在F1得分 (76.10%) 中领先.
- 双子 1.5 闪光显示最高准确度 (80.53%) 和F1得分 (84.54%) 与示例引导提示; 克劳德 3.5 索内特有最高的DCG (0.63).
- 所有的LLM都被CNN模型所超越;开源的Llama在诊断排名中表现强.
结论:
- 七个评估的LLM目前缺乏足够的诊断性能用于OLP检测的临床应用.
- 专门训练用于OLP检测的CNN与测试的LLMs相比,表现优越.
- 需要进一步开发,以提高LLM的能力,以便在口腔粘膜病变诊断中可靠的临床使用.


