ÎncepețiÎncepe gratuit

Preprocesarea imaginilor

În acest exercițiu, vei folosi setul de date flickr, care conține 30.000 de imagini și descrieri asociate, pentru a efectua operații de preprocesare pe imagini. Această preprocesare este necesară pentru ca datele vizuale să fie compatibile cu inferența prin modelele Hugging Face, cum ar fi generarea de text din imagini. În acest caz, vei genera o descriere text pentru această imagine:

Fotografie cu 2 persoane, una cântând la chitară

Setul de date (dataset) a fost încărcat cu următoarea structură:

Dataset({
    features: ['image', 'caption', 'sentids', 'split', 'img_id', 'filename'],
    num_rows: 10
})

Modelul de descriere a imaginilor (model) a fost încărcat.

Acest exercițiu face parte din cursul

Modele Multi-Modale cu Hugging Face

Vezi cursul

Instrucțiuni pentru exercițiu

  • Încarcă imaginea din elementul de la indexul 5 al setului de date.
  • Încarcă procesorul de imagini (BlipProcessor) al modelului preantrenat: Salesforce/blip-image-captioning-base.
  • Aplică procesorul pe image, asigurându-te că specifici că sunt necesari tensori PyTorch (pt).
  • Folosește metoda .generate() pentru a genera o descriere cu ajutorul model.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load the image from index 5 of the dataset
image = dataset[5]["____"]

# Load the image processor of the pretrained model
processor = ____.____("Salesforce/blip-image-captioning-base")

# Preprocess the image
inputs = ____(images=____, return_tensors="pt")

# Generate a caption using the model
output = ____(**inputs)
print(f'Generated caption: {processor.decode(output[0])}')
print(f'Original caption: {dataset[5]["caption"][0]}')
Editează și rulează codul