使用EfficientNet和通过注意力转换的混合注意力转换器检测膀病变
Poonam Sharma1, Bhisham Sharma2, Dhirendra Prasad Yadav3
1Chitkara University Institute of Engineering and Technology, Chitkara University, Rajpura, Punjab, 140401, India.
Scientific reports
|May 23, 2025
概括
这项研究引入了一种混合卷积神经网络 (CNN) 和视觉转换器 (ViT) 模型,用于从内镜图像中准确诊断膀癌症. 这种新的方法显著提高了对现有方法的诊断性能.
科学领域:
- 医疗成像医学成像
- 人工智能的人工智能
- 在瘤学瘤学.
背景情况:
- 膀癌的诊断是复杂的,因为瘤异质和细胞形态,使手动方法耗时.
- 目前的机器学习和深度学习方法在实时应用中面临限制,原因是手动功能工程或广泛的数据要求.
研究的目的:
- 开发一种混合卷积神经网络 (CNN) 和视觉转换器 (ViT) 模型,以高效准确地诊断膀癌症.
- 克服传统机器学习和深度学习方法在实时膀病变检测方面的局限性.
主要方法:
- 开发了一种混合模型,将InceptionV3块用于空间特征提取和视觉变压器 (ViT) 编码器与混合注意力模块用于全球特征关联.
- 该模型在17,540张内镜图像的数据集上进行了训练和评估,使用5倍交叉验证策略.
主要成果:
- 拟议的混合CNN-ViT模型实现了高性能指标:97.73%的平均精度,97.21%的精度,96.86%的F1-score.
- 对比分析表明,在相同的实验条件下,混合模型的性能优于独立的CNN和ViT方法.
结论:
- 开发的混合CNN-ViT模型为自动化膀癌诊断通过内镜图像提供了一个有前途,可靠和高效的解决方案.
- 这种方法解决了手动诊断的挑战和现有的AI方法的局限性,为改进的临床应用铺平了道路.


