在肌肉骨放射学解剖学中评估大型语言模型:与放射科医生的比较研究
1Atatürk Eğitim ve Araştırma Hastanesi, Radyoloji Kliniği, 35150 Karabaglar, İzmir, Türkiye. dralisalbas@gmail.com.
Joint diseases and related surgery
|December 14, 2025
概括
大型语言模型 (LLM) 在基于文本的解剖学问题上表现出色,但在肌肉骨放射学中难以解释图像. 人类放射科医生在视觉任务的诊断准确性方面仍然优越.
科学领域:
- 放射学 放射学是一门学科.
- 人工智能的人工智能
- 医学教育 医学教育
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于医学应用.
- 在像肌肉骨放射学这样的专业领域评估LLM诊断性能至关重要.
研究的目的:
- 评估LLM在肌肉骨放射解剖学的诊断准确性.
- 为了比较LLM的表现与不同经验水平的放射科医生.
主要方法:
- 使用了来自Radiopaedia的175个多选题 (基于图像和仅以文本为基础).
- 三个LLM (ChatGPT-4o,克劳德3.7索内特,Grok3) 在零射击环境下进行了评估.
- 研究人员将LLM的反应与一名主治放射科医生和两名住院医生的反应进行了比较.
主要成果:
- 主治放射科医生准确度最高 (79.4%),其次是高级 (72.6%) 和初级住院医生 (66.9%).
- 聊天GPT-4o领先于LLMs (69.7%),在基于文本的问题上表现出色 (88.2%).
- 在基于文本的问题上,LLM的表现优于放射科医生,但在图像解释方面表现明显低.
结论:
- 在基于文本的解剖学知识方面,LLM显得有前途,但在基于图像的肌肉骨放射学方面存在局限性.
- 人类放射科医生在视觉解释任务中表现出卓越的准确性.
- LLM 可以作为教育辅助工具,但需要进一步开发临床图像分析.


