# queryquery = "What is CLIP's contrastive loss function?"# embed query (4 steps)# 1) load modelmodel = CLIPTextModelWithProjection.from_pretrained("openai/clip-vit-base-patch16")# 2) load data processorprocessor = CLIPProcessor.from_pretrained("openai/clip-vit-base-patch16")# 3) pre-process textinputs = processor(text=[text], return_tensors="pt", padding=True)# 4) compute embeddings with CLIPoutputs = model(**inputs)# extract embeddingquery_embed = outputs.text_embedsprint(query_embed.shape)# >> torch.Size([1, 512])