混合模型整合了LeViT变压器和蒸技术,用于模式检测和舞蹈分类.
1School of Education, Shanghai Donghai Vocational and Technical College, Shanghai, 200241, China. wangyanyan3528@163.com.
Scientific reports
|December 30, 2025
概括
本研究介绍了一种轻量级的视觉转换器 (LeViT),用于对中国舞蹈进行分类,其性能优于标准的视觉转换器 (ViT) 和卷积神经网络 (CNN) 模型. 人工智能通过先进的图像分析增强了文化遗产的保护.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 保护文化遗产 保护文化遗产
背景情况:
- 人工智能 (AI) 对于现代应用,包括文化遗产,越来越重要.
- 将中国舞蹈等传统艺术形式分类为独特的视觉分析挑战.
- 现有的计算机视觉模型需要加强在文化数据中细微的模式识别.
研究的目的:
- 为了评估传统中国舞蹈分类的基于变压器的模型.
- 引入和评估一个轻量级的视觉变压器 (LeViT) 与蒸以改善特征捕获.
- 将LeViT的性能与标准视觉变压器 (ViT) 和卷积神经网络 (CNN) 的基准进行比较.
主要方法:
- 使用了三种传统中国舞蹈形式的数据集,并进行了预处理 (消除噪音,增强,对比度增强).
- 实施和训练了一种轻量级的视觉变压器 (LeViT) 模型,配有蒸机制.
- 与标准视觉变压器 (ViT) 和使用监督训练和特征提取的卷积神经网络 (CNN) 模型进行基准LeViT.
主要成果:
- 拟议的LeViT模型在对中国舞蹈类型的分类方面取得了卓越的准确性和稳定性.
- 与标准ViT和CNN基线相比,LeViT表现更好.
- 基于变压器的架构有效地捕获了微妙的运动线索和细粒度的空间模式在舞蹈图像中.
结论:
- 轻量级视觉变压器 (LeViT) 为人工智能驱动的文化遗产保护提供了一个有希望的方法.
- 变压器模型擅长分析传统艺术形式中复杂的视觉模式.
- 这项研究为使用先进的人工智能技术进行视觉艺术分类提供了强大的框架.
