在1933年对开源LLM的诊断性能进行比较,Eurorad案例报告
Su Hwan Kim1, Severin Schramm2, Lisa C Adams3
1Department of Diagnostic and Interventional Neuroradiology, Klinikum rechts der Isar, School of Medicine and Health, Technical University of Munich, Munich, Germany. suhwan.kim@tum.de.
NPJ digital medicine
|February 11, 2025
概括
开源大型语言模型 (LLM) 显示出支持放射性诊断的前景,Llama-3-70B在性能上与GPT-4o等专有模型紧密相匹配. 这些人工智能工具可以帮助对复杂病例进行差异诊断.
科学领域:
- 人工智能在医学中的应用
- 放射学和医学成像学 医学成像学
背景情况:
- 大型语言模型 (LLM) 在医学诊断中提供了新的应用.
- 与专有模式相比,开源LLM在成本和访问方面具有潜在的优势.
- 在现实世界的临床场景中评估LLM绩效至关重要.
研究的目的:
- 评估开源和封闭源LLM在放射差异诊断中的诊断性能.
- 用一个大型的公共数据集和一个私人数据集来比较各种LLM的准确性.
- 确定开源LLM作为放射学临床决策支持工具的潜力.
主要方法:
- 在Eurorad图书馆的1933个案例中评估了15个开源的LLMs和GPT-4o.
- 根据临床病史和成像发现,LLM产生了差异诊断.
- 测试了来自第三级医院的60个非公开的大脑MRI病例的概括性.
主要成果:
- 在两个数据集中,GPT-4o表现出卓越的诊断性能.
- 拉玛-3-70B表现出强的性能,紧随其后的是GPT-4o.
- 开源LLM正在迅速改善并缩小与专有模型的性能差距.
结论:
- 开源的LLM正在变得越来越有能力进行放射性差异诊断.
- 这些模型显示出在具有挑战性的放射病例中作为决策支持工具的巨大潜力.
- 开源LLM的持续开发可以增强放射学中的诊断工作流程.


