Învățare zero-shot cu CLIP
Vei folosi învățarea zero-shot pentru a clasifica o imagine din setul de date rajuptvs/ecommerce_products_clip, care conține aproximativ 2.000 de imagini de produse împreună cu descrierile asociate:

Setul de date (dataset), CLIPProcessor (processor) și CLIPModel (model) au fost încărcate pentru tine, împreună cu o listă de categorii:
categories = ["shirt", "trousers", "shoes", "dress", "hat",
"bag", "watch", "glasses", "jacket", "belt"]
Acest exercițiu face parte din cursul
Modele Multi-Modale cu Hugging Face
Instrucțiuni pentru exercițiu
- Folosește
processorpentru a preprocesacategoriesși imaginea de la indexul999dindataset; activează padding-ul. - Transmite
inputsdespachetat cătremodel. - Calculează probabilitățile fiecărei categorii folosind atributul
.logits_per_imageși metoda.softmax(). - Găsește categoria cea mai probabilă folosind
probsșicategories.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Preprocess the categories and image
inputs = ____(text=____, images=____, return_tensors="pt", padding=____)
# Process the unpacked inputs with the model
outputs = ____
# Calculate the probabilities of each category
probs = outputs.____.____(dim=1)
# Find the most likely category
category = categories[probs.____.item()]
print(f"Predicted category: {category}")