BaşlayınÜcretsiz başlayın

CLIP ile zero-shot öğrenme

rajuptvs/ecommerce_products_clip veri kümesinden bir görseli zero-shot öğrenmeyle sınıflandıracaksın. Bu veri kümesi, ürünlere ait açıklamalarla birlikte yaklaşık 2 bin ürün görseli içerir:

Image of a woman modeling a dress

Senin için veri kümesi (dataset), CLIPProcessor (processor) ve CLIPModel (model) yüklendi; ayrıca bir kategori listesi de var:

categories = ["shirt", "trousers", "shoes", "dress", "hat", 
              "bag", "watch", "glasses", "jacket", "belt"]

Bu egzersiz, kursun bir parçasıdır

Hugging Face ile Multi-Modal Modeller

Kursa Göz Atın

Egzersiz talimatları

  • processor ile categories ve dataset'in 999 indeksindeki görseli ön işlemeden geçir; padding'i etkinleştir.
  • Açılmış inputsmodel'e aktar.
  • .logits_per_image özelliği ve .softmax() metodunu kullanarak her kategori için olasılıkları hesapla.
  • probs ve categories kullanarak en olası kategoriyi bul.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Preprocess the categories and image 
inputs = ____(text=____, images=____, return_tensors="pt", padding=____)

# Process the unpacked inputs with the model
outputs = ____

# Calculate the probabilities of each category
probs = outputs.____.____(dim=1)

# Find the most likely category
category = categories[probs.____.item()]
print(f"Predicted category: {category}")
Kodu Düzenle ve Çalıştır