ÎncepețiÎncepe gratuit

Învățare zero-shot cu CLIP

Vei folosi învățarea zero-shot pentru a clasifica o imagine din setul de date rajuptvs/ecommerce_products_clip, care conține aproximativ 2.000 de imagini de produse împreună cu descrierile asociate:

Image of a woman modeling a dress

Setul de date (dataset), CLIPProcessor (processor) și CLIPModel (model) au fost încărcate pentru tine, împreună cu o listă de categorii:

categories = ["shirt", "trousers", "shoes", "dress", "hat", 
              "bag", "watch", "glasses", "jacket", "belt"]

Acest exercițiu face parte din cursul

Modele Multi-Modale cu Hugging Face

Vezi cursul

Instrucțiuni pentru exercițiu

  • Folosește processor pentru a preprocesa categories și imaginea de la indexul 999 din dataset; activează padding-ul.
  • Transmite inputs despachetat către model.
  • Calculează probabilitățile fiecărei categorii folosind atributul .logits_per_image și metoda .softmax().
  • Găsește categoria cea mai probabilă folosind probs și categories.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Preprocess the categories and image 
inputs = ____(text=____, images=____, return_tensors="pt", padding=____)

# Process the unpacked inputs with the model
outputs = ____

# Calculate the probabilities of each category
probs = outputs.____.____(dim=1)

# Find the most likely category
category = categories[probs.____.item()]
print(f"Predicted category: {category}")
Editează și rulează codul