在口腔病变评估中,与人类专家相比,ChatGPT-5和gemini 2.5 pro的基于视觉的诊断收益比人类专家更高
Fatma E A Hassanein1, Radwa R Hussein2, Hadeel Gamal Almalahy2
1Oral Medicine, Periodontology, and Oral Diagnosis, Faculty of Dentistry, King Salman International University, El-Tor, Egypt.
Scientific reports
|December 5, 2025
概括
多模式大语言模型 (LLM) 在口腔医学诊断方面表现有前途. 与Gemini 2.5 Pro不同,ChatGPT-5显著提高了对图像的诊断准确性,并突出了AI.
科学领域:
- 口腔医学是指口腔医学.
- 人工智能的人工智能
- 医学诊断 医学诊断 医学诊断
背景情况:
- 在口腔医学中,多式大型语言模型 (LLM) 的诊断实用性在临床环境中基本上没有得到检查.
- 评估人工智能诊断性能需要能够捕捉到整合各种数据类型 (如图像) 的价值的指标.
研究的目的:
- 引入和验证基于视觉的诊断收益 (VWDG),这是一个新的指标,用于量化将图像纳入人工智能辅助口腔损伤诊断中的诊断改进.
- 在现实世界,活检验证的口服药物数据集中使用VWDG进行ChatGPT-5和Gemini 2.5 Pro的对比比较.
主要方法:
- 一个前性的,对200个口腔病变病例进行了与临床照片和X射线图相匹配的案例研究.
- 在纯文本和多模式 (文本+图像) 条件下对ChatGPT-5和Gemini 2.5 Pro与经过董事会认证的口腔医学专家进行评估.
- 用图像集成计算VWDG作为诊断准确度的提高 (Top-1,Top-3,Top-5差异);使用Cochran's Q和配对的McNemar测试进行统计分析.
主要成果:
- 两种LLM都显示出强大的基线仅文本准确性,但性能与图像集成有所不同.
- 聊天GPT-5表现出显著的VWDG (顶部-1: +19%,顶部-3: +18%,顶部-5: +14%的精度增长;p <0.001),特别是在恶性/困难病例中.
- 双子座2.5 Pro显示VWDG值得忽略或负值,在文本占主导地位的场景中表现最好;人类专家在简单/良性病例中表现出色.
结论:
- 聊天GPT-5充当视觉协同作用者,通过图像集成增强AI诊断,而Gemini 2.5 Pro充当文本专家.
- VWDG指标为评估和比较口腔医学中的多式人工智能诊断工具提供了临床上有意义的框架.
- 结果表明一个合作的人类-AI诊断范式,强调基于其特定优势的AI工具的上下文意识集成.


