一年后:评估RSNA2024多模式大型语言模型性能在RSNA2024多模式大型语言模型表现的进展案例当天的问题
Benjamin Hou1, Pritam Mukherjee2, Vivek Batheja2
1Division of Intramural Research, National Library of Medicine, National Institutes of Health, Bethesda, Md.
Radiology
|August 12, 2025
概括
多式联络大型语言模型 (LLM) 的最新进展显示,在解释放射病例方面取得了重大进展. 新的OpenAI模型表现出与专家放射科医生可比的性能.
科学领域:
- 医疗成像中的人工智能
- 放射学人工智能的人工智能
- 多模式大型语言模型
背景情况:
- 越来越多地采用具有视觉功能的多式大型语言模型 (LLM).
- 需要量化这些AI模型在放射学中的性能.
研究的目的:
- 评估和量化多式联络LLM的进步,以解释放射测试病例.
- 将AI模型的性能与高级放射科医生的性能进行比较.
主要方法:
- 使用95个RSNA 2024"当天案例"问题进行回顾性研究.
- 基线与RSNA 2023的76个问题进行比较.
- 评估了OpenAI,谷歌双子座和Meta Llama模型.
- 用麦克内马尔测试与两名高级放射科医生比较AI准确度.
主要成果:
- OpenAI o1 (59%) 和GPT-4o (54%) 在2024个病例中显示出高准确度.
- 双子 1.5 Pro (36%) 和拉玛 3.2 (33%) 的分数较低.
- OpenAI o1 的准确性与放射科医生 (58%和66%) 的准确性相当.
结论:
- 多模式LLM在一年内取得了实质性的进展.
- 开放AI的最新模型的表现优于谷歌和Meta的模型.
- 在OpenAI o1和放射科医生准确度之间没有发现统计学上显著的差异.


