CXR-LLaVA:用于解释胸部X射线图像的多式大型语言模型
Seowoo Lee1, Jiwon Youn2, Hyungjin Kim1
1Department of Radiology, Seoul National University College of Medicine, Seoul National University Hospital, Seoul, Republic of Korea.
European radiology
|January 15, 2025
概括
本研究介绍了CXR-LLaVA,CXR-LLaVA是用于胸部X射线解释的开源多式大型语言模型. 该模型显示了检测异常和生成报告的潜力,旨在协助放射科医生.
科学领域:
- 人工智能的人工智能
- 医疗成像医学成像
- 放射学 放射学是一门学科.
背景情况:
- 大型语言模型 (LLM) 在各个领域都显得有前途.
- 解释像胸部X射线 (CXRs) 这样的医疗图像是复杂且耗时的.
- 开发人工智能工具来协助放射科医生可以提高效率和准确性.
研究的目的:
- 开发一个开源的多式大型语言模型 (CXR-LLaVA) 用于胸部X射线 (CXR) 解释.
- 利用LLM来复制人类放射科医生的图像解释技能.
- 评估该模型在自主放射性报告方面的潜力.
主要方法:
- 收集了超过592,000个公开可用的CXR,有和没有标签.
- 预先训练了一个视觉变换器,并将其与LLaVA影响的LLM集成.
- 使用放射学报告微调模型,并评估其诊断性能和报告可接受性.
主要成果:
- 对于主要的病理发现,CXR-LLaVA实现了0.81 (内部) 和0.56 (外部) 的F1得分.
- 该模型在测试套件上表现优于GPT-4视觉和Gemini-Pro-Vision.
- 人类放射科医生的评估显示,自主报告的成功率为72.7%.
结论:
- 多模式LLM具有显著的CXR解释潜力,尽管目前的局限性.
- 预计CXR-LLaVA的开源性质将加速研究和开发.
- 该模型显示了支持放射科医生的潜力,减少工作量并提高效率.


