基于视觉先验的交叉模式对齐网络,用于生成放射学报告
Sheng Zhang1, Chuan Zhou1, Leiting Chen1
1Key Laboratory of Digital Media Technology of Sichuan Province, University of Electronic Science and Technology of China, Chengdu, 611731, China.
Computers in biology and medicine
|October 11, 2023
概括
本研究介绍了一种基于视觉先验的跨模态对齐网络,用于自动生成放射学报告. 该模型通过结合视觉先验和改进图像-文本对齐来提高准确性,优于现有方法.
科学领域:
- 人工智能的人工智能
- 医疗成像医学成像
- 自然语言处理自然语言处理.
背景情况:
- 自动化放射学报告生成旨在减少放射科医生的工作量并提高诊断准确性.
- 现有的方法在整合视觉先验和对准图像-文本特征方面扎.
研究的目的:
- 开发一个先进的自动化放射学报告生成模型,解决先前方法的局限性.
- 改善异常区域的识别和放射图像与生成的报告之间的一致性.
主要方法:
- 提出了一个基于视觉先验的交叉模式对齐网络.
- 引入对比 注意从图像中提取视觉前置 (差异信息).
- 开发了一种交叉模式对齐网络,用于使用预先训练的模型进行图像-文本特征对齐.
- 实现视觉预先引导多头注意力,用于将视觉预先集成到报告生成中.
主要成果:
- 拟议的模型在IU-Xray和MIMIC-CXR数据集上表现出卓越的性能.
- 获得了高的BLEU-4分数 (0.188,0.116) 和CIDEr分数 (0.409,0.240),超过了最先进的模型.
- 有效地识别异常,改善图像-文本一致性.
结论:
- 基于视觉先验的交叉模式对齐网络显著推进了自动化放射学报告的生成.
- 整合视觉先验和交叉模式对齐可以提高模型的准确性和可靠性.
- 这种方法对医学成像分析中的临床应用具有前景.


