BaşlayınÜcretsiz başlayın

Görüntü ön işleme

Bu egzersizde, 30.000 görüntü ve bunlara ait altyazılar içeren flickr veri kümesini kullanarak görüntüler üzerinde ön işleme yapacaksın. Bu ön işlemeler, görüntü verisini Hugging Face model görevleriyle (ör. görüntülerden metin üretimi) çıkarım için uygun hale getirmek için gereklidir. Bu örnekte, aşağıdaki görüntü için bir metin altyazısı üreteceksin:

Photo of 2 people with 1 playing the guitar

Veri kümesi (dataset) aşağıdaki yapıyla yüklendi:

Dataset({
    features: ['image', 'caption', 'sentids', 'split', 'img_id', 'filename'],
    num_rows: 10
})

Görüntü altyazılama modeli (model) yüklendi.

Bu egzersiz, kursun bir parçasıdır

Hugging Face ile Multi-Modal Modeller

Kursa Göz Atın

Egzersiz talimatları

  • Veri kümesinin 5 indeksindeki öğeden görüntüyü yükle.
  • Önceden eğitilmiş modelin görüntü işlemcisini (BlipProcessor) yükle: Salesforce/blip-image-captioning-base.
  • İşlemciyi image üzerinde çalıştır ve PyTorch tensörlerinin (pt) gerektiğini belirtmeyi unutma.
  • .generate() yöntemini kullanarak model ile bir altyazı üret.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Load the image from index 5 of the dataset
image = dataset[5]["____"]

# Load the image processor of the pretrained model
processor = ____.____("Salesforce/blip-image-captioning-base")

# Preprocess the image
inputs = ____(images=____, return_tensors="pt")

# Generate a caption using the model
output = ____(**inputs)
print(f'Generated caption: {processor.decode(output[0])}')
print(f'Original caption: {dataset[5]["caption"][0]}')
Kodu Düzenle ve Çalıştır