VQA s Vision Language Transformers (ViLTs)
Čas vyzkoušet si multimodální generování – začneme vizuálním zodpovídáním otázek (VQA). Pomocí modelu dandelin/vilt-b32-finetuned-vqa zjistíš, jakou barvu má semafor na následujícím obrázku:

Preprocesor (processor), model (model) a obrázek (image) jsou již načteny.
Toto cvičení je součástí kurzu
Multi-Modal Models with Hugging Face
Pokyny k cvičení
- Předzpracuj textový prompt
texta obrázekimage. - Vygeneruj výstupní tokeny odpovědi pomocí modelu a ulož je do
outputs. - Najdi ID odpovědi s nejvyšší mírou jistoty pomocí výstupních logitů.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
text = "What color is the traffic light?"
# Preprocess the text prompt and image
encoding = ____(____, ____, return_tensors="pt")
# Generate the answer tokens
outputs = ____
# Find the ID of the answer with the highest confidence
idx = outputs.logits.____
print("Predicted answer:", model.config.id2label[idx])