从临床图像生成文本描述的视觉语言模型:模型开发和验证研究
Jia Ji1, Yongshuai Hou2, Xinyu Chen3
1Shenzhen Institute of Information Technology, Shenzhen, China.
JMIR formative research
|February 8, 2024
概括
这项研究介绍了ClinicalBLIP,这是一种用于自动生成放射学报告的AI模型. 临床BLIP通过整合先进的视觉语言模型来显著提高报告质量,以更好地解释图像和创建文本.
科学领域:
- 人工智能在医学中的应用
- 医学成像分析 医学成像分析
- 自然语言处理自然语言处理.
背景情况:
- 自动生成放射学报告对于医疗保健标准化至关重要.
- 人工智能和自然语言处理可以加速报告创建.
- 现有的方法往往不充分利用先进的视觉语言模型.
研究的目的:
- 整合预训练的视觉语言模型,用于自动生成放射学报告.
- 使用人工智能将临床图像转换为高质量的文本报告.
主要方法:
- 开发了基于 InstructBLIP 的 ClinicalBLIP,在临床图像到文本数据集上进行了微调.
- 采用多阶段微调方法,低级调整以提高理解能力.
- 通过快速学习整合了先前的知识,以提高报告的准确性.
主要成果:
- 临床BLIP在IU X-RAY和MIMIC-CXR数据集上获得了优异的METEOR和ROUGE得分.
- 性能超过了现有的最先进的方法.
- 多阶段微调和先前信息整合显著改善了结果.
结论:
- 临床BLIP证明了强大而有效的临床放射学报告生成.
- 该模型对现实世界的临床应用具有显著的前景.
- 由人工智能驱动的报告生成提高了医疗保健质量和标准化.


