基于混合功能培训的有效和高效的自我监督的蒙面模型
Qingjiu Kang1, Feng Liu2, Chunliu Cai3
1Institute of Artificial Intelligence, Guangzhou University, Guangzhou, Guangdong, China.
Frontiers in neurorobotics
|November 17, 2025
概括
本研究介绍了一种基于混合特征训练 (EESMM) 的有效和高效的自我监督面具模型,用于更快的图像处理. 在不影响准确性的情况下,EESMM显著减少了面具图像建模的预培训时间.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 人工智能的人工智能
背景情况:
- 蒙面图像建模 (MIM) 使用注意力机制进行蒙面图像训练,类似于蒙面语言建模 (MLM).
- 目前的MIM方法面临着高的计算复杂性和时间成本,这是由于重建掩盖图像区域的广泛代.
- 现有的方法需要大量的计算资源来处理单个图像在掩盖训练范式.
研究的目的:
- 根据混合特征培训 (EESMM) 开发一个有效和高效的自我监督的蒙面模型.
- 为了减少与蒙面图像建模相关的计算复杂性和时间成本.
- 为了加速图像模型的预训练过程,而不会牺牲性能.
主要方法:
- 从堆叠的图像中输入融合特征到网络中,以减少计算负载并增强特征学习.
- 采用解码策略,利用原始和混合图像的特征来改善表示.
- 在解码过程中构建一个专门的损失函数,以提高特征表示质量.
主要成果:
- 在ImageNet上,EESMM实现了83%的准确性.
- 该模型仅用4个V100 GPU在363小时内完成了预训练.
- 这意味着与SimMIM相比,培训时间减少了十倍,显示出显著的加速.
结论:
- 欧洲经济和社会事务会议大大加快了面具图像建模的预培训过程.
- 拟议的方法实现了具有竞争力的准确性,同时大大减少了计算时间.
- 在计算机视觉任务中,EESMM为自主监督学习提供了一个有效的替代方案.
