Začněte nyníZačněte zdarma

VQA s Vision Language Transformers (ViLTs)

Čas vyzkoušet si multimodální generování – začneme vizuálním zodpovídáním otázek (VQA). Pomocí modelu dandelin/vilt-b32-finetuned-vqa zjistíš, jakou barvu má semafor na následujícím obrázku:

Picture of a traffic light showing red

Preprocesor (processor), model (model) a obrázek (image) jsou již načteny.

Toto cvičení je součástí kurzu

Multi-Modal Models with Hugging Face

Zobrazit kurz

Pokyny k cvičení

  • Předzpracuj textový prompt text a obrázek image.
  • Vygeneruj výstupní tokeny odpovědi pomocí modelu a ulož je do outputs.
  • Najdi ID odpovědi s nejvyšší mírou jistoty pomocí výstupních logitů.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

text = "What color is the traffic light?"

# Preprocess the text prompt and image
encoding = ____(____, ____, return_tensors="pt")

# Generate the answer tokens
outputs = ____

# Find the ID of the answer with the highest confidence
idx = outputs.logits.____
print("Predicted answer:", model.config.id2label[idx])
Upravit a spustit kód