在VIT-B/16中基于相对位置编码和残留MLP的脑瘤分类
Shuang Hong1, Jin Wu1, Lei Zhu1
1School of Information Science and Engineering, Wuhan University of Science and Technology, Wuhan, Hubei, China.
PloS one
|July 2, 2024
概括
这项研究引入了一种增强的视觉转换器算法,用于准确的脑瘤分类. 改进后的模型达到91.36%的准确性,帮助医疗从业者进行早期诊断.
科学领域:
- 医疗成像医学成像
- 人工智能的人工智能
- 计算机视觉 计算机视觉
背景情况:
- 脑瘤诊断依赖于耗时,主观的手动图像分析.
- 现有的方法面临着小型数据集的挑战和深度学习模型的局限性.
- 对脑瘤的准确和早期分类对于患者的治疗结果至关重要.
研究的目的:
- 开发一个改进的视觉转换器 (VIT) 算法,用于增强脑瘤分类.
- 为了解决数据集的局限性,并提高模型捕获空间信息的能力.
- 提高自动脑瘤诊断的准确性和效率.
主要方法:
- 应用数据增强技术:同型过,频道对比度有限的自适应直方图平衡和不清晰的掩盖.
- 引入了一种新的相对位置编码方法,以增强视觉变压器的自我注意力机制.
- 纳入多层感知器中的残余结构,以提高训练的趋同性和准确性.
主要成果:
- 拟议的算法在增强数据集上实现了91.36%的分类准确性.
- 与原来的VIT-B/16模型相比,显示出5.54%的显著改进.
- 展示了增强的精度和回忆,验证了模型的有效性.
结论:
- 改进的视觉转换器算法显著提高了脑瘤分类的准确性.
- 数据增强和架构修改有效地解决了模型的限制.
- 开发的模型显示承诺作为一个有价值的工具,用于临床决策支持在神经瘤学.


