VQA cu Vision Language Transformers (ViLT-uri)
E momentul să explorezi generarea multi-modală, începând cu răspunsul vizual la întrebări (VQA). Vei folosi modelul dandelin/vilt-b32-finetuned-vqa pentru a determina culoarea semaforului din imaginea de mai jos:

Preprocesoarul (processor), modelul (model) și imaginea (image) au fost deja încărcate pentru tine.
Acest exercițiu face parte din cursul
Modele Multi-Modale cu Hugging Face
Instrucțiuni pentru exercițiu
- Preprocesează promptul
textșiimage. - Generează token-urile de răspuns din model și atribuie rezultatul variabilei
outputs. - Găsește ID-ul răspunsului cu cea mai mare încredere folosind logit-urile din output.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
text = "What color is the traffic light?"
# Preprocess the text prompt and image
encoding = ____(____, ____, return_tensors="pt")
# Generate the answer tokens
outputs = ____
# Find the ID of the answer with the highest confidence
idx = outputs.logits.____
print("Predicted answer:", model.config.id2label[idx])