相关实验视频
Updated: Jun 6, 2025

14:13
Coordinate Mapping of Hyolaryngeal Mechanics in Swallowing
Published on: May 6, 2014
18.2K
放射学中的大型语言模型:随着时间的推移,性能波动和不一致性减少
Mitul Gupta1, John Virostko2, Christopher Kaufmann1
1The University of Texas at Austin, Dell Medical School, Department of Diagnostic Medicine, Austin, TX, USA.
European journal of radiology
|November 24, 2024
概括
这项研究评估了放射学中的大型语言模型 (LLM),发现GPT-4最初最准确,但随着时间的推移而下降. 持续的基准测试对于评估医学应用中的LLM可靠性至关重要.
科学领域:
- 人工智能在医学中的应用
- 医学成像信息学 医疗成像信息学
- 在医疗保健中的自然语言处理.
背景情况:
- 大型语言模型 (LLM) 在放射学等医疗专业中展示了近乎专家的性能.
- 有限的比较数据存在于LLM性能,精度和可靠性随着时间的推移在放射学.
研究的目的:
- 在三个月的时间内,评估和监测放射学LLM的性能和内部可靠性.
- 为未来的放射学LLM绩效评估建立一个基础的基准.
主要方法:
- 从2023年11月到2024年1月,每月查询四个LLM (GPT-4,GPT-3.5,克劳德,谷歌巴德).
- 用ACR诊断在培训考试 (DXIT) 的实践问题来评估模型的准确性.
- 通过答案不匹配或模型内部不一致来评估内部一致性.
主要成果:
- GPT-4获得了最高的初始精度 (78%),其次是Bard (73%),Claude (71%) 和GPT-3.5 (63%).
- 在研究期间,GPT-4的准确性下降 (82%至74%),而Claude的准确性增加 (70%至73%).
- 所有LLM的模型内部不一致性都下降了,这表明一致性有所改善;性能因子专业而异.
结论:
- LLM (不包括GPT-3.5) 的准确度超过了70%,显示了重要的领域知识.
- 波动性表现突出了持续,放射学特定的基准测试指标的需要.
- 在临床整合之前,标准化的评估对于衡量LLM可靠性至关重要.

