默林:一个视觉语言基础模型用于3D计算机断层扫描
Louis Blankemeier1,2,3, Joseph Paul Cohen2, Ashwin Kumar2,3
1Department of Electrical Engineering, Stanford University.
Research square
|July 9, 2024
概括
默林是一种新的3D视觉语言模型 (VLM),使用EHR数据和报告来解释腹部CT扫描. 这种人工智能工具增强了医疗图像分析和疾病预测,在单个GPU上高效训练.
科学领域:
- 医疗成像中的人工智能
- 放射学和医学信息学
- 计算机视觉和自然语言处理
背景情况:
- 在美国,每年有数以百万计的腹部CT扫描需要放射科医生的解释.
- 目前用于医学成像的AI模型通常仅限于2D数据和简短的报告.
- 需要先进的人工智能来协助放射科医生,并从复杂的扫描中提取新的见解.
研究的目的:
- 介绍Merlin,一个用于腹部CT解释的3D视觉语言模型 (VLM).
- 在没有手动注释的情况下,利用电子健康记录 (EHR) 和放射学报告进行预训练.
- 增强自动化医疗图像分析,并从CT扫描中提取生理洞察力.
主要方法:
- 在一个庞大的临床数据集上训练默林:600多万张CT图像,180多万张EHR诊断码和600多万张放射学报告令牌.
- 在6种任务类型上评估Merlin,包括零射击分类,交叉模式检索,慢性疾病预测,报告生成和3D细分.
- 对各种CT数据集进行内部和外部验证,包括公共基准.
主要成果:
- 默林在多个评估任务中与现有的特定任务基线相比表现良好.
- 该模型在零射击发现和表型分类以及跨模式检索方面取得了强的结果.
- 在单个GPU上实现了高效的训练,表明了民主化AI模型开发的潜力.
结论:
- 默林代表了3DVLMs对于腹部CT解释的重大进步.
- 该模型能够整合EHR数据和非结构化报告,为临床决策支持提供了强大的工具.
- 计算效率高的培训方法有助于在医疗保健环境中更广泛地采用先进的人工智能.
更多相关视频
11:09Construction of a Realistic, Whole-Body, Three-Dimensional Equine Skeletal Model using Computed Tomography Data
Published on: February 25, 2021
3.1K
07:57Scaled Anatomical Model Creation of Biomedical Tomographic Imaging Data and Associated Labels for Subsequent Sub-surface Laser Engraving SSLE of Glass Crystals
Published on: April 25, 2017
8.4K
