CLIP ile zero-shot öğrenme
rajuptvs/ecommerce_products_clip veri kümesinden bir görseli zero-shot öğrenmeyle sınıflandıracaksın. Bu veri kümesi, ürünlere ait açıklamalarla birlikte yaklaşık 2 bin ürün görseli içerir:

Senin için veri kümesi (dataset), CLIPProcessor (processor) ve CLIPModel (model) yüklendi; ayrıca bir kategori listesi de var:
categories = ["shirt", "trousers", "shoes", "dress", "hat",
"bag", "watch", "glasses", "jacket", "belt"]
Bu egzersiz, kursun bir parçasıdır
Hugging Face ile Multi-Modal Modeller
Egzersiz talimatları
processorilecategoriesvedataset'in999indeksindeki görseli ön işlemeden geçir; padding'i etkinleştir.- Açılmış
inputs'ımodel'e aktar. .logits_per_imageözelliği ve.softmax()metodunu kullanarak her kategori için olasılıkları hesapla.probsvecategorieskullanarak en olası kategoriyi bul.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Preprocess the categories and image
inputs = ____(text=____, images=____, return_tensors="pt", padding=____)
# Process the unpacked inputs with the model
outputs = ____
# Calculate the probabilities of each category
probs = outputs.____.____(dim=1)
# Find the most likely category
category = categories[probs.____.item()]
print(f"Predicted category: {category}")