Görüntü ön işleme
Bu egzersizde, 30.000 görüntü ve bunlara ait altyazılar içeren flickr veri kümesini kullanarak görüntüler üzerinde ön işleme yapacaksın. Bu ön işlemeler, görüntü verisini Hugging Face model görevleriyle (ör. görüntülerden metin üretimi) çıkarım için uygun hale getirmek için gereklidir. Bu örnekte, aşağıdaki görüntü için bir metin altyazısı üreteceksin:

Veri kümesi (dataset) aşağıdaki yapıyla yüklendi:
Dataset({
features: ['image', 'caption', 'sentids', 'split', 'img_id', 'filename'],
num_rows: 10
})
Görüntü altyazılama modeli (model) yüklendi.
Bu egzersiz, kursun bir parçasıdır
Hugging Face ile Multi-Modal Modeller
Egzersiz talimatları
- Veri kümesinin
5indeksindeki öğeden görüntüyü yükle. - Önceden eğitilmiş modelin görüntü işlemcisini (
BlipProcessor) yükle:Salesforce/blip-image-captioning-base. - İşlemciyi
imageüzerinde çalıştır ve PyTorch tensörlerinin (pt) gerektiğini belirtmeyi unutma. .generate()yöntemini kullanarakmodelile bir altyazı üret.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Load the image from index 5 of the dataset
image = dataset[5]["____"]
# Load the image processor of the pretrained model
processor = ____.____("Salesforce/blip-image-captioning-base")
# Preprocess the image
inputs = ____(images=____, return_tensors="pt")
# Generate a caption using the model
output = ____(**inputs)
print(f'Generated caption: {processor.decode(output[0])}')
print(f'Original caption: {dataset[5]["caption"][0]}')