在thangka图像中使用gabor,波形和颜色特征融合增强对象检测
Yukai Xian1, Yurui Lee2, Te Shen1
1School of Information Science and Technology, Tibet University, Lhasa 850000, China.
Sensors (Basel, Switzerland)
|September 19, 2025
概括
这项研究引入了一种新的频率和预先增强的对象检测框架,用于复杂的Thangka图像. 该方法显著提高了检测精度和复杂细节和小目标的回忆.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 数字遗产是数字遗产的一部分.
背景情况:
- 卡图像分析由于复杂的图像形象,密集的小尺寸元素和独特的色彩纹理组成而带来了挑战.
- 现有的物体检测模型往往无法在这样的专业图像中捕捉全球结构和本地细节.
- 在当前的文化遗产文物检测框架中,域特定的视觉先验很少被使用.
研究的目的:
- 开发一个先进的物体检测框架,以适应卡图像的具体挑战.
- 增强模型检测全球结构和细粒度局部细节的能力.
- 将特定领域的视觉先验,包括色彩和方向线索,纳入检测过程中.
主要方法:
- 提出了一个基于YOLOv11.11的频率和预先增强检测框架.
- 引入了一个可学习的升起波形块 (LLWB) 用于频率分解和多尺度融合.
- 设计了一种颜色加博区块 (CGBlock) 和颜色加博交叉门 (C2CG),以结合色彩和定向特征.
- 重新设计的检测头具有分离的分支,中心性预测,以及用于小目标的额外浅头.
主要成果:
- 在一个精心策划的Thangka数据集上实现了89.5%的mAP@0.5和59.4%的mAP@[0.5:0.95].
- 达到84.7%的召回率,超过了基线检测器.
- 保持了2090万参数的紧型号尺寸.
结论:
- 拟议的框架为复杂的遗产图像中细粒度物体检测提供了强大的和可解释的解决方案.
- 频率分解和特定域的先前集成显著提高了检测性能.
- 该模型有效地解决了卡艺术中复杂的细节和小物体所带来的挑战.


