CLIP-Llama: A New Approach for Scene Text Recognition with a Pre-Trained Vision-Language Model and a Pre-Trained

Xiaoqing Zhao1, Miaomiao Xu1, Wushour Silamu1

  • 1College of Computer Science and Technology, Xinjiang University, No. 777 Huarui Street, Urumqi 830017, China.

PubMed

Related Concept Videos