模仿:临床预先指导层次视觉语言预训练
IEEE transactions on medical imaging
|August 26, 2024
概括
本研究介绍了IMITATE,这是医学视觉语言预训练 (VLP) 的新框架,利用临床报告的层次结构. 通过将多层次的图像功能与不同的报告部分对齐,IMITATE 增强了 VLP,从而在多个医学成像任务中提高了性能.
科学领域:
- 人工智能的人工智能
- 医疗成像医学成像
- 自然语言处理自然语言处理.
背景情况:
- 医学视觉语言预训练 (VLP) 通常从临床报告和图像中提取特征.
- 现有的VLP方法往往忽略了临床报告的固有层次结构 (例如",发现"和"印象").
- 目前的方法过于简化了单个实体或碎片化的代币的报告,丢失了有价值的结构信息.
研究的目的:
- 提出一个新的临床先导VLP框架,模仿.
- 利用医疗报告的等级结构来改善视觉语言对齐.
- 通过专门的对比性损失,通过结合临床先验知识来增强VLP.
主要方法:
- 开发了IMITATE,一个具有层次视觉语言对齐的VLP框架.
- 从胸部X射线 (CXR) 图像中获得多层次的视觉特征.
- 单独对齐的视觉特征与描述性 ("发现") 和结论性 ("印象") 文本段.
- 引入了跨模式学习的临床知情对比损失.
主要成果:
- 模仿明显优于基线的VLP方法.
- 该模型在六个不同的数据集中展示了卓越的性能.
- 在五个不同的医疗成像下游任务中验证了有效性.
- 实验结果证实了在VLP的医疗报告中使用等级结构的好处.
结论:
- 拟议的IMITATE框架有效地利用了医学VLP临床报告的层次结构.
- 层次对齐和临床知情的对比学习提高了VLP模型的性能.
- 该研究强调了将特定领域的结构信息纳入医疗VLP的重要性.
更多相关视频
07:36Eye Tracking During Visually Situated Language Comprehension: Flexibility and Limitations in Uncovering Visual Context Effects
Published on: November 30, 2018
15.7K
09:27Using Eye Movements Recorded in the Visual World Paradigm to Explore the Online Processing of Spoken Language
Published on: October 13, 2018
10.0K
