在口腔和大面部解剖学中对大型语言模型视觉能力的基准测试:一个横截面研究
Viet Anh Nguyen1, Thi Quynh Trang Vuong2, Van Hung Nguyen3
1Faculty of Dentistry, Phenikaa University, Hanoi, Vietnam.
PloS one
|October 28, 2025
概括
多模式大语言模型 (LLM) 在识别解剖学地标方面显示中度准确性,目前没有模型是可靠的独立工具. 性能差异很大,更高的准确性往往会与增加的处理时间相抵触.
科学领域:
- 人工智能的人工智能
- 医疗成像医学成像
- 解剖学教育 解剖学教育
背景情况:
- 多模式大语言模型 (LLM) 越来越能够进行图像解释.
- 这些LLM在特定解剖学任务中的准确性在很大程度上仍未得到评估.
研究的目的:
- 评估公开可用的多式联络LLM在识别解剖学地标方面的准确性和一致性.
- 将不同LLM模型及其推理模式在标准化解剖学基准上的性能进行比较.
主要方法:
- 一个基于地图的基准研究,使用26个解剖板上的260个编号地标.
- 在深度推理和低延迟模式下测试了六个聊天端点 (OpenAI,微软Copilot,谷歌Gemini).
- 盲人解剖学讲师对答案的准确性,一致性和延迟性进行了评分.
主要成果:
- 在模型之间观察到精度的显著差异 (p < 0.001).
- OpenAI o3显示了最高的正确性 (53.1%),但具有最长的延迟.
- 肌肉骨结构比神经血管目标更准确地确定;一致性从43.5%到65.0%不等.
结论:
- 目前的多式联络LLM只能适度地识别口腔和大面部标志.
- 目前没有LLM终点可作为独立的答案密钥可靠,需要域特定的调整和人类监督.
- 开发的亚特拉斯基准提供了一种可重复的方法来评估未来的LLM解剖学改进.


