Začněte nyníZačněte zdarma

Předzpracování obrázků

V tomto cvičení použiješ dataset flickr, který obsahuje 30 000 obrázků s popisky, a provedeš předzpracování obrázků. Tenhle krok je nutný k tomu, aby byla obrazová data vhodná pro inferenci s modely z Hugging Face – například pro generování textu z obrázků. V tomto případě vygeneruješ textový popisek k tomuto obrázku:

Photo of 2 people with 1 playing the guitar

Dataset (dataset) byl načten s touto strukturou:

Dataset({
    features: ['image', 'caption', 'sentids', 'split', 'img_id', 'filename'],
    num_rows: 10
})

Model pro tvorbu popisků obrázků (model) byl načten.

Toto cvičení je součástí kurzu

Multi-Modal Models with Hugging Face

Zobrazit kurz

Pokyny k cvičení

  • Načti obrázek z prvku na indexu 5 v datasetu.
  • Načti procesor obrázků (BlipProcessor) předtrénovaného modelu: Salesforce/blip-image-captioning-base.
  • Spusť procesor na image a nezapomeň specifikovat, že jsou vyžadovány PyTorch tensory (pt).
  • Pomocí metody .generate() vytvoř popisek s využitím model.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load the image from index 5 of the dataset
image = dataset[5]["____"]

# Load the image processor of the pretrained model
processor = ____.____("Salesforce/blip-image-captioning-base")

# Preprocess the image
inputs = ____(images=____, return_tensors="pt")

# Generate a caption using the model
output = ____(**inputs)
print(f'Generated caption: {processor.decode(output[0])}')
print(f'Original caption: {dataset[5]["caption"][0]}')
Upravit a spustit kód