使用大型语言模型生成的提示符从合成MRI脑部扫描报告中提取特征:一个横截面研究
John J Hanna1,2,3, Christopher S Evans2,4, Christopher R Dennis2
1Department of Internal Medicine, ECU Brody School of Medicine, Greenville, North Carolina, United States.
Methods of information in medicine
|February 19, 2026
概括
大型语言模型 (LLM) 显示出从MRI脑报告中提取特征的前景. 像GPT-4这样的新型号的性能很好,LLM甚至可以为此任务生成有效的提示.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能在医学中的应用
背景情况:
- 从医疗报告中自动提取特征对于临床,操作和研究目的至关重要.
- 大型语言模型 (LLM) 提供了从临床文本中自动提取特征和类别分配的潜力.
研究的目的:
- 为了比较从MRI脑扫描报告中提取特征的准确性,使用临床医生设计的与LLM生成的提示.
- 评估五个OpenAI LLM在从合成MRI报告中提取预定义特征方面的性能.
主要方法:
- 五个OpenAI LLM被测试了他们从合成MRI大脑报告中提取九个二进制特征的能力.
- 使用了两种提示类型:临床医生设计和LLM生成. 使用回忆力,精度,准确性和F1分数来评估性能.
主要成果:
- 在所有模型和提示中观察到高整体性能,平均回忆率为0.956,精度为0.9347,准确度为0.982,F1得分为0.9431.
- 使用LLM生成提示符的GPT-3.5-turbo显示出更好的性能,而GPT-4模型无论提示符类型如何,都始终优于其他模型.
结论:
- LLM显示出从MRI脑报告中精确提取特征的巨大潜力,像GPT-4这样的新型模型显示出强大的性能.
- 选择LLM和快速工程策略显著影响从医学成像报告中自动提取特征的有效性.


