检测眼镜的多元数据集:扩大Flickr-Faces-HQ (FFHQ) 数据集
1Department of Electronic Systems, Vilnius Gediminas Technical University (VILNIUS TECH), 10105 Vilnius, Lithuania.
Sensors (Basel, Switzerland)
|December 17, 2024
概括
这项研究增强了Flickr-Faces-HQ (FFHQ) 数据集,为眼镜检测提供了精确的界限框注释. 扩展的FFHQ数据集改善了面部分析和眼镜检测模型的以数据为中心的AI.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 人工智能的人工智能
背景情况:
- 面部分析对于计算机视觉和机器学习应用至关重要.
- 像FFHQ这样的现有数据集缺乏面部配件,特别是眼镜的详细注释.
- 以数据为中心的人工智能需要高质量,多样化和注释良好的数据集.
研究的目的:
- 解决眼镜检测面部数据集中的注释差距.
- 以精确的眼镜界限框注释来扩展FFHQ数据集.
- 为培训和比较眼镜检测模型创建一个有价值的资源.
主要方法:
- 一个半自动化的协议被用来有效地生成眼镜的界限框注释.
- FFHQ数据集扩展到包括超过16000张眼镜图像.
- 深度学习模型 (YOLOv8,MobileNetV3) 用于基线性能评估.
主要成果:
- 扩展的FFHQ数据集包含7万张图像,在尺寸和多样性方面超过CelebAMask-HQ.
- 在扩展FFHQ数据集上训练的模型在眼镜检测方面表现出优异的表现,而不是在CelebAMask-HQ上训练的模型.
- 交叉数据集验证证实了在丰富的数据集上训练的模型的稳定性.
结论:
- 扩展的FFHQ数据集是推动眼镜检测研究的宝贵资源.
- 该数据集支持面部分析中的以数据为中心的AI方法.
- 预计数据集的公开可用性将促进面部配件检测的未来研究和开发.


