ECCT:通过伪罗视觉转换器和多视图增强效率高效的对比集群
Xing Wei1, Taizhang Hu2, Di Wu3
1School of Computer and Information, Hefei University of Technology, Hefei, 230601, China; Intelligent Manufacturing Technology Research Institute, Hefei University of Technology, Hefei, 230601, China.
概括
本研究介绍了通过伪罗视觉转换器和多视图增强 (ECCT) 进行高效对比聚类,以改进图像聚类. 通过整合全球信息和语义连续性,ECCT增强了特征表示,优于现有的方法.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 深度学习 (Deep Learning) 是一种深度学习.
背景情况:
- 图像聚类对于组织未标记的图像数据至关重要.
- 对比式学习方法擅长学习歧视性特征,但与全球信息和语义连续性作斗争.
- 现有的方法通常具有有限的特征分布,阻碍了对比学习在集群中的潜力.
研究的目的:
- 提出一种新的深度集群框架,即通过伪罗视觉转换器和多视图增强 (ECCT) 进行高效对比集群.
- 解决捕获全球信息的现有方法的局限性,维护语义连续性和扩大特征分布.
- 通过使用先进的深度学习技术来提高图像聚类的性能.
主要方法:
- 引入了一个伪罗视觉转换器 (ViT) 框架,包含一个希尔伯特补丁嵌入 (HPE) 模块用于全球特征提取.
- 融合了两个ViT分支机构的特征,以实现全球视图和语义连贯性.
- 采用多视图随机攻击增强来多样化特征分布,并学习更丰富的对比特征.
主要成果:
- 与现有的集群方法相比,ECCT在五个基准数据集中表现出卓越的表现.
- 在STL-10数据集上获得0.852的调整后兰德指数 (ARI),表现比最佳基线高10.3%.
- 在ImageNet-Dogs数据集中,ECCT达到0.424的ARI,比最佳基线提高4.8%.
结论:
- ECCT有效地解决了图像集群中的全球信息捕获和语义连续性的挑战.
- 拟议的框架显著提高了全面和丰富的对比特征的学习.
- ECCT代表了深度集群的实质性进步,提供了更好的准确性和稳定性.


