研究深度神经网络和人类对象图像相似性判断之间的细粒度和粗粒度结构对应性,使用无监督对齐
Soh Takahashi1, Masaru Sasaki1, Ken Takeda1
1Graduate School of Arts and Science, University of Tokyo, 3-8-1 Komaba, Meguro-ku, 153-8902, Tokyo, Japan.
概括
使用CLIP训练的深度神经网络 (DNN) 在详细和广泛的层面上显示类似人类的对象表示. 自主监督模型捕捉了广泛的类别,但缺乏细致的细节,突出了语言.
科学领域:
- 认知科学 认知科学
- 神经科学是一个神经科学.
- 人工智能的人工智能
- 计算机视觉 计算机视觉
背景情况:
- 了解人类如何形成内部对象表示是认知科学的关键挑战.
- 深度神经网络 (DNN) 为研究这些机制提供了一个计算框架,因为它们具有类似人类的内部表示.
- 以前的研究表明,各种训练方法 (监督,自我监督,CLIP) 产生类似人类的表现,但细粒度的相似性仍然不清楚.
研究的目的:
- 调查深度神经网络 (DNN) 对象表示是否与人类表示在粗略和细粒度层面相匹配.
- 将不同范式 (CLIP,自我监督) 训练的模型与人类对象表示的表示相似性进行比较.
- 阐明语言信息在获得精确对象表示中的作用.
主要方法:
- 使用Gromov-Wasserstein最佳传输的无监督对齐方法来比较人类和DNN对象表示.
- 评估细粒度和粗粒度的匹配,通过估计个人对象的人类和模型表示之间的最佳映射.
- 从THINGS数据集中对1854个对象使用了人类相似性判断.
主要成果:
- 使用CLIP训练的模型显示出强烈的细粒度和粗粒度与人类对象表示的匹配.
- 自主监督的模型在细粒度和粗粒度水平上都表现出有限的匹配.
- 自主监督的模型成功地聚集了反映人类粗体类别结构的对象.
结论:
- 与自我监督模型相比,CLIP训练的模型可以更全面地捕捉人类对象的表现,包括细微的细节.
- 通过CLIP使用的语言信息似乎对于获得精确的对象表示至关重要.
- 自主监督学习显示了在对象表示中捕捉粗略分类结构的潜力.

