Zacznij terazZacznij za darmo

Generowanie podpisów obrazów za pomocą potoku

W tym ćwiczeniu ponownie skorzystasz ze zbioru danych flickr, który zawiera 30 000 obrazów wraz z przypisanymi podpisami. Tym razem wygenerujesz podpis do poniższego obrazu, używając potoku zamiast klas auto.

Zdjęcie mężczyzny stojącego na drabinie i myjącego okno

Zbiór danych (dataset) został załadowany z następującą strukturą:

Dataset({
    features: ['image', 'caption', 'sentids', 'split', 'img_id', 'filename'],
    num_rows: 10
})

Moduł potoku (pipeline) jest już załadowany.

To ćwiczenie jest częścią kursu

Modele multimodalne z Hugging Face

Zobacz kurs

Instrukcje do ćwiczenia

  • Załaduj potok image-to-text z wstępnie wytrenowanym modelem Salesforce/blip-image-captioning-base.
  • Użyj potoku, aby wygenerować podpis dla obrazu o indeksie 3.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Load the image-to-text pipeline
pipe = pipeline(task="____", model="____")

# Use the pipeline to generate a caption with the image of datapoint 3
pred = ____(dataset[3]["____"])

print(pred)
Edytuj i uruchom kod