Zero-shot učení s CLIP
Pomocí zero-shot učení klasifikuješ obrázek z datasetu rajuptvs/ecommerce_products_clip, který obsahuje přibližně 2 000 obrázků produktů spolu s jejich popisky:

Dataset (dataset), CLIPProcessor (processor) a CLIPModel (model) jsou už načteny, stejně jako seznam kategorií:
categories = ["shirt", "trousers", "shoes", "dress", "hat",
"bag", "watch", "glasses", "jacket", "belt"]
Toto cvičení je součástí kurzu
Multi-Modal Models with Hugging Face
Pokyny k cvičení
- Pomocí
processoru předzpracujcategoriesa obrázek na indexu999zdatasetu; povol padding. - Předej rozbalené
inputsdomodelu. - Vypočítej pravděpodobnosti jednotlivých kategorií pomocí atributu
.logits_per_imagea metody.softmax(). - Najdi nejpravděpodobnější kategorii pomocí
probsacategories.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Preprocess the categories and image
inputs = ____(text=____, images=____, return_tensors="pt", padding=____)
# Process the unpacked inputs with the model
outputs = ____
# Calculate the probabilities of each category
probs = outputs.____.____(dim=1)
# Find the most likely category
category = categories[probs.____.item()]
print(f"Predicted category: {category}")