评估多式大型语言模型,用于在全景放射图上定位牙植入物固定装置
Yuichi Mine1, Tsuyoshi Taji2, Saori Takeda1
1Project Research Center for Integrating Digital Dentistry, Hiroshima University, 1-2-3 Kasumi Minami-ku, Hiroshima, 734-8553, Japan; Department of Medical Systems Engineering, Graduate School of Biomedical and Health Sciences, Hiroshima University, 1-2-3 Kasumi Minami-ku, Hiroshima, 734-8553, Japan.
Journal of dentistry
|February 18, 2026
概括
专注于推理的大型语言模型 (LLM) 显示牙植入物固定装置在放射图上定位的希望,但准确性和一致性的局限性阻止了自主临床使用.
科学领域:
- 放射学中的人工智能
- 医学成像分析 医学成像分析
- 牙科植入物学 牙科植入物学
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于医学图像分析.
- 在全景放射图上精确定位牙植入物固定装置对于治疗规划和监测至关重要.
- 目前用于牙科放射学的AI工具往往缺乏通用性和稳定性.
研究的目的:
- 评估通用多式联动LLM在全景X射线图上检测牙科植入物固定装置的能力.
- 量化这些模型在没有植入物固定装置的图像上产生的假阳性率.
- 为了比较不同多式联络LLM在这个特定的临床任务中的表现.
主要方法:
- 使用了一个开源数据集,包括82张植入物固定装置的全景射线图和82张植入物固定装置不存在的全景射线图.
- 测试了三个多式联网LLM (GPT-4o,OpenAI o3,GPT-5T) 使用一个一致的视觉接地提示在每张图像的五个运行.
- 使用微敏度,完整检测率 (CDR),每张图像错误阳性 (FPPI) 和特异性 (无盒率) 等指标评估性能.
主要成果:
- 专注于推理的LLM (OpenAI o3,GPT-5T) 显示出更高的微敏度 (约. 67%) 和CDR (大约. 58%) 与GPT-4o相比 (大约. 17%和2.2%). 这两者分别是17%和2.2%.
- 与GPT-4o (FPPI- ≈1.9) 相比,GPT-5T和OpenAI o3在没有植入物的图像上显示了较低的假阳性率 (FPPI- ≈1.0).
- 无线不透明的修复显著降低了模型的特异性,并且在所有运行过程中,只有很小一部分检测到的固定装置被一致识别出来.
结论:
- 多模式LLM显示了零射击牙植入物固定装置定位的潜力,以推理为中心的模型优于GPT-4o.
- 目前,中度敏感性,与修复相关的错误以及运行之间的变化限制了它们在临床工作流程中的自主应用.
- 这项研究为评估LLM在与植入物相关的放射性任务中建立了基准,突出了未来发展的领域.


