对放射学诊断提取的大型语言模型的跨机构评估:即时工程视角
Mana Moassefi1, Sina Houshmand2, Shahriar Faghani1
1Mayo Clinic Artificial Intelligence Lab, Department of Radiology, Mayo Clinic, 200 1st Street, S.W., Rochester, MN, 55905, USA.
Journal of imaging informatics in medicine
|May 9, 2025
概括
人类优化的提示有效地使用大型语言模型 (LLM) 进行跨机构的放射学报告注释. 这种方法在识别发现方面表现出高度的一致性和准确性,Llama 3.1 70b表现最好.
科学领域:
- 医疗成像中的人工智能
- 医疗保健的自然语言处理.
背景情况:
- 大型语言模型 (LLM) 显示了自动化放射学报告分析的潜力.
- 放射学报告的准确注释对于临床决策和研究至关重要.
研究的目的:
- 通过使用多个机构的LLM来评估人类优化的标签放射学报告提示符的有效性.
- 在多机构环境中评估基于LLM的注释的一致性和准确性.
主要方法:
- 六个机构收集了五个类别的500份放射学报告.
- 一个标准化的Python脚本在每个网站上本地执行一个常见的LLM,并以人为优化的提示符.
- 为了计算准确度,LLM预测与调查人员提供的参考标签进行了比较.
主要成果:
- 人类优化的提示显示了不同机构和病理学的高一致性.
- 在LLM输出和调查员标签之间观察到显著的一致性.
- 拉玛3.1 70b在识别特定发现方面取得了最高的表现,在不同地点显示出强大的适应性.
结论:
- 使用LLM优化提示工程是跨机构放射学报告标签的可行方法.
- 该方法简单,准确,并且可以适应报告结构和机构实践的变化.
- 未来的研究应该专注于模型的稳定性和各种报告结构的快速通用性.


