好奇的普通人:没有专家标签的细粒度图像识别
Subhabrata Choudhury1, Iro Laina1, Christian Rupprecht1
1Visual Geometry Group, University of Oxford, Oxford, OX1 3PJ UK.
概括
本研究引入了一种新的方法,通过使用网络百科全书,在没有专家注释的情况下进行细粒度图像识别. 该方法利用视觉描述和文本相似性,将图像与知识库相匹配,提高机器学习能力.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 人类具有解释图像和语言的天生的能力,使得知识在没有专家监督的情况下得到扩展.
- 当前的机器学习模型在没有广泛的,专门的训练数据的情况下,在精细的识别方面扎.
- 访问和利用专家策划的知识库仍然是人工智能的重大挑战.
研究的目的:
- 通过使用易于获得的网络知识来解决细粒度图像识别的挑战.
- 开发一种不依赖专家注释的图像识别方法.
- 使机器能够从庞大的,非结构化的在线信息中学习.
主要方法:
- 从非专家的图像描述中学习视觉描述模型.
- 训练一个细粒度的文本相似性模型,用于句子级图像-文本匹配.
- 利用网络百科全书作为知识来源.
主要成果:
- 拟议的方法证明了有效的细粒度图像识别.
- 绩效是根据CUB-200和Oxford-102的花数据集进行评估的.
- 与强大的基线和最先进的跨模式检索方法相比,这种方法显示出具有竞争力的结果.
结论:
- 通过利用网络规模的知识,可以在没有专家注释的情况下实现细粒度图像识别.
- 开发的方法为人工智能系统提供了一个有希望的方向,可以在有限的监督下学习和识别对象.
- 这项工作促进了人工智能在需要详细视觉理解的领域的更广泛应用.


