无监督的对比精细化与图形意识多模式交互用于放射学报告生成
IEEE journal of biomedical and health informatics
|March 4, 2026
概括
一个新的医学上下文感知放射学报告生成框架 (MedCARF) 通过更好地对准医疗图像和文本来提高准确性. 它增强了胸部X射线和膝关节骨关节炎的报告生成,显示出显著的性能增长.
科学领域:
- 人工智能的人工智能
- 医疗成像医学成像
- 自然语言处理自然语言处理.
背景情况:
- 自动放射学报告生成 (RRG) 旨在通过从X射线图像生成报告来减少工作量.
- 以前的方法通过图像分类和结合临床结果改进了RRG,但遭受了不一致的跨模式学习和杂的标签.
- 这些局限性导致了不准确的注意力机制和不变的报告生成.
研究的目的:
- 解决当前RRG方法的局限性,特别是不充分利用文字信息和依赖噪音标签.
- 提出一个新的医疗上下文意识的RRG框架 (MedCARF) 以实现更准确和更强大的放射学报告生成.
- 评估MedCARF在胸部X射线和膝关节骨关节炎数据集上的表现,包括多式联络数据集成.
主要方法:
- 引入了疾病意识视觉文本对齐 (D-ViTAlign) 模块,以使用场景图和视觉特征捕捉器官异常关系.
- 实施了无监督的增强蒸与对比精细化 (AuDiCoR) 损失,用于标签精细化和代视觉特征增强.
- 在膝关节骨关节炎倡议 (OAI) 数据集上对MedCARF进行了基准测试,并将其性能与膝关节RRG的生物力学数据进行了评估.
主要成果:
- 在METEOR中取得了至少3.2%的改善,在胸部X射线的最新分类上获得了4.22%的AUC增长.
- 在所有自然语言生成 (NLG) 指标中观察到9.69%的平均改善,用于膝盖RRG与生物力学数据集成.
- 在少数群体类别中表现出一致的分类表现,表明强度.
结论:
- MedCARF生成了上下文准确的放射学报告,克服了以前RRG方法的局限性.
- 该框架显示出稳健性和临床适用性,改善了报告生成和分类准确性.
- 提出的方法,D-ViTAlign和AuDiCoR,有效地提高跨模式学习和标签精细化在RRG.
