CLIP: Contrastive Language–Image Pretraining model. Transferable Visual Models From Natural Language