关于图像-文本多式模式进步的调查:从一般技术到生物医学实施
Ruifeng Guo1, Jingxuan Wei1, Linzhuang Sun1
1Shenyang Institute of Computing Technology, Chinese Academy of Sciences, Shenyang, 110168, China; University of Chinese Academy of Sciences, Beijing, 100049, China.
Computers in biology and medicine
|June 15, 2024
概括
本调查回顾了图像-文本多式模式模型,详细介绍了它们的技术演变和对生物医学应用的影响. 它分析了一般模型的进步和特定领域的挑战,为未来的研究提供了解决方案.
科学领域:
- 人工智能的人工智能
- 自然语言处理自然语言处理.
- 计算机视觉 计算机视觉
背景情况:
- 大型语言模型 (LLM) 刺激了自然语言处理 (NLP) 的进步.
- 图像-文本多式模式集成视觉和文本数据,获得了大量的研究关注.
- 现有的调查往往忽视了一般模型对特定领域进步的影响.
研究的目的:
- 审查图像-文本多式模式模型的技术演变.
- 分析一般模型开发对生物医学多式联络技术的影响.
- 识别和应对一般和特定领域的多式联运模式开发方面的挑战.
主要方法:
- 审查从特征空间到大型模型架构的技术演变.
- 分析图像-文本多式模式模型的常见组件,任务和挑战.
- 总结一般模型架构,组件和数据,重点关注生物医学应用.
主要成果:
- 一般图像-文本多式联络技术显著促进生物医学多式联络进步.
- 生物医学数据集对于模型开发具有独特的重要性和复杂性.
- 挑战被分为2个外部因素和5个内在因素,并提出解决方案.
结论:
- 了解一般模型的演变对于特定领域的研究至关重要.
- 针对多式联运模型开发和应用中的挑战,提供了有针对性的解决方案.
- 这项调查指导了图像-文本多式联络人工智能的未来研究方向.


