,使

Soh Takahashi1, Masaru Sasaki1, Ken Takeda1

  • 1Graduate School of Arts and Science, University of Tokyo, 3-8-1 Komaba, Meguro-ku, 153-8902, Tokyo, Japan.

概括

使用CLIP训练的深度神经网络 (DNN) 在详细和广泛的层面上显示类似人类的对象表示. 自主监督模型捕捉了广泛的类别,但缺乏细致的细节,突出了语言.