相关实验视频
Updated: Jun 29, 2026

06:35
Basics of Multivariate Analysis in Neuroimaging Data
Published on: July 24, 2010
16.8K
在神经成像临床决策支持中对大语言模型实用性的比较评估
Luke Miller1, Peter Kamel2, Jigar Patel3
1Department of Radiology, University of Maryland Medical Center, Baltimore, MD, USA. Luke.Miller@umm.edu.
Journal of imaging informatics in medicine
|November 7, 2024
概括
大型语言模型 (LLM) 被评估为它们提供最佳神经放射学成像建议的能力. 与Bard和Llama 2等其他模型相比,GPT-4和ChatGPT表现出优异的性能.
科学领域:
- 医疗成像医学成像
- 人工智能的人工智能
- 放射学 放射学是一门学科.
背景情况:
- 越来越多的成像利用引发了人们对临床场景中的适当性的担忧.
- 大型语言模型 (LLM) 为医疗保健提供者提供了潜在的可访问资源.
- 在产生医学成像推方面,LLM的性能尚未得到充分研究.
研究的目的:
- 评估和比较八个LLM的成像建议的适当性和有用性.
- 在应对常见的神经放射学临床场景时评估LLM绩效.
- 确定最有效的LLM来指导最佳的医疗图像订单.
主要方法:
- 24个神经放射学临床场景被用于查询8个LLM (ChatGPT,GPT-4,Bard v1/v2,Bing Chat,Llama 2,困惑,克劳德).
- 查询评估了LLM在最佳图像排序方面提供准确,可操作的建议的能力.
- 神经放射学家根据ACR适当性标准和新奥尔良头部CT标准对建议进行了分级.
主要成果:
- GPT-4获得了最高的适当率 (23/24),其次是ChatGPT (20/24),困惑 (19/24) 和克劳德 (19/24).
- 拉玛2 (5/24) 和巴德v1 (13/24) 的适当率较低.
- 在提供最佳建议方面,GPT-4和ChatGPT的表现普遍优于Bard,Bing Chat和Llama 2.
结论:
- 在提供适当的神经放射学成像建议方面,LLM显示出可变的性能.
- GPT-4和ChatGPT是帮助医疗成像决策的有希望的工具.
- 需要进一步的研究来完善LLM用于放射学临床决策支持.
更多相关视频
13:12Translational Brain Mapping at the University of Rochester Medical Center: Preserving the Mind Through Personalized Brain Mapping
Published on: August 12, 2019
45.1K
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
504