在牙科执照考试上对多式联络大型语言模型进行基准测试:临床图像解释方面的挑战
Yuichi Mine1,2, Shota Okazaki1,2, Tsuyoshi Taji3
1Project Research Center for Integrating Digital Dentistry, Hiroshima University, Hiroshima, Japan.
Journal of dental sciences
|October 3, 2025
概括
较新的大型语言模型在基于文本的牙科考试问题上表现强,但在视觉组件上扎. 模型o1在准确度上领先,表明了牙科教育的潜力,尽管复杂的视觉诊断存在局限性.
科学领域:
- 人工智能在牙科中的应用
- 多模式大型语言模型
- 牙科教育技术 牙科教育技术
背景情况:
- 大型语言模型 (LLM) 在基于文本的医疗保健应用中表现有前途.
- 它们在多式联络牙科环境中的实用性,整合文本和视觉数据,仍然在很大程度上未被探索.
- 这项研究通过评估牙科执照考试问题上的LLM来弥补这一差距.
研究的目的:
- 评估四个领先的多式联络LLM在牙科执照考试中的表现.
- 为了比较他们对纯文本和基于视觉的牙科问题的准确性.
- 在牙科知识评估中识别当前LLM的优缺点.
主要方法:
- 四个多模式的LLM (ChatGPT-4o,OpenAI o1,Claude 3.5 Sonnet,Gemini 2.0 Flash Thinking Experimental) 进行了评估.这些LLM的使用方法包括:
- 这些模型在2024年日本国家牙科考试中的353个问题上进行了测试 (204个仅文本,149个视觉).
- 采用零射击方法,使用统计测试分析性能,包括Cochran的Q和McNemar的测试与Bonferroni校正.
主要成果:
- OpenAI o1获得了最高的整体正确答案率 (81.9%),其次是Sonnet (71.7%),Gemini (66.6%) 和4o (65.7%).
- 所有模型在仅以文本为基础的问题上 (79.9%-92.2%) 的表现明显好于以视觉为基础的问题 (45.6%-67.8%).
- 性能因牙科专业而异,在基础科学中得分较高,在视觉依赖的临床领域 (如正牙科) 得分较低.
结论:
- 多模式的LLM显示出牙科教育和基于文本的临床支持的巨大潜力.
- 目前的模型在牙科中准确解释复杂的视觉信息方面面临挑战.
- 为了在视觉密集的诊断任务中可靠应用,需要进一步的进展.


