Předzpracování obrázků
V tomto cvičení použiješ dataset flickr, který obsahuje 30 000 obrázků s popisky, a provedeš předzpracování obrázků. Tenhle krok je nutný k tomu, aby byla obrazová data vhodná pro inferenci s modely z Hugging Face – například pro generování textu z obrázků. V tomto případě vygeneruješ textový popisek k tomuto obrázku:

Dataset (dataset) byl načten s touto strukturou:
Dataset({
features: ['image', 'caption', 'sentids', 'split', 'img_id', 'filename'],
num_rows: 10
})
Model pro tvorbu popisků obrázků (model) byl načten.
Toto cvičení je součástí kurzu
Multi-Modal Models with Hugging Face
Pokyny k cvičení
- Načti obrázek z prvku na indexu
5v datasetu. - Načti procesor obrázků (
BlipProcessor) předtrénovaného modelu:Salesforce/blip-image-captioning-base. - Spusť procesor na
imagea nezapomeň specifikovat, že jsou vyžadovány PyTorch tensory (pt). - Pomocí metody
.generate()vytvoř popisek s využitímmodel.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load the image from index 5 of the dataset
image = dataset[5]["____"]
# Load the image processor of the pretrained model
processor = ____.____("Salesforce/blip-image-captioning-base")
# Preprocess the image
inputs = ____(images=____, return_tensors="pt")
# Generate a caption using the model
output = ____(**inputs)
print(f'Generated caption: {processor.decode(output[0])}')
print(f'Original caption: {dataset[5]["caption"][0]}')