ÎncepețiÎncepe gratuit

VQA cu Vision Language Transformers (ViLT-uri)

E momentul să explorezi generarea multi-modală, începând cu răspunsul vizual la întrebări (VQA). Vei folosi modelul dandelin/vilt-b32-finetuned-vqa pentru a determina culoarea semaforului din imaginea de mai jos:

Picture of a traffic light showing red

Preprocesoarul (processor), modelul (model) și imaginea (image) au fost deja încărcate pentru tine.

Acest exercițiu face parte din cursul

Modele Multi-Modale cu Hugging Face

Vezi cursul

Instrucțiuni pentru exercițiu

  • Preprocesează promptul text și image.
  • Generează token-urile de răspuns din model și atribuie rezultatul variabilei outputs.
  • Găsește ID-ul răspunsului cu cea mai mare încredere folosind logit-urile din output.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

text = "What color is the traffic light?"

# Preprocess the text prompt and image
encoding = ____(____, ____, return_tensors="pt")

# Generate the answer tokens
outputs = ____

# Find the ID of the answer with the highest confidence
idx = outputs.logits.____
print("Predicted answer:", model.config.id2label[idx])
Editează și rulează codul