Začněte nyníZačněte zdarma

Zero-shot učení s CLIP

Pomocí zero-shot učení klasifikuješ obrázek z datasetu rajuptvs/ecommerce_products_clip, který obsahuje přibližně 2 000 obrázků produktů spolu s jejich popisky:

Obrázek ženy v šatech

Dataset (dataset), CLIPProcessor (processor) a CLIPModel (model) jsou už načteny, stejně jako seznam kategorií:

categories = ["shirt", "trousers", "shoes", "dress", "hat", 
              "bag", "watch", "glasses", "jacket", "belt"]

Toto cvičení je součástí kurzu

Multi-Modal Models with Hugging Face

Zobrazit kurz

Pokyny k cvičení

  • Pomocí processoru předzpracuj categories a obrázek na indexu 999 z datasetu; povol padding.
  • Předej rozbalené inputs do modelu.
  • Vypočítej pravděpodobnosti jednotlivých kategorií pomocí atributu .logits_per_image a metody .softmax().
  • Najdi nejpravděpodobnější kategorii pomocí probs a categories.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Preprocess the categories and image 
inputs = ____(text=____, images=____, return_tensors="pt", padding=____)

# Process the unpacked inputs with the model
outputs = ____

# Calculate the probabilities of each category
probs = outputs.____.____(dim=1)

# Find the most likely category
category = categories[probs.____.item()]
print(f"Predicted category: {category}")
Upravit a spustit kód