VQA avec Vision Language Transformers (ViLT)
C'est le moment d'essayer la génération multimodale, en commençant par le Visual Question-Answering (VQA). Vous utiliserez le modèle dandelin/vilt-b32-finetuned-vqa pour déterminer la couleur du feu de circulation dans l'image suivante :

Le préprocesseur (processor), le modèle (model) et l'image (image) ont été chargés pour vous.
Cette activité fait partie du cours
Modèles multimodaux avec Hugging Face
Instructions de l’exercice
- Prétraitez l'invite
textet l'image. - Générez les jetons de réponse à partir du modèle et assignez-les à
outputs. - Trouvez l'identifiant de la réponse la plus probable en utilisant les logits de sortie.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
text = "What color is the traffic light?"
# Preprocess the text prompt and image
encoding = ____(____, ____, return_tensors="pt")
# Generate the answer tokens
outputs = ____
# Find the ID of the answer with the highest confidence
idx = outputs.logits.____
print("Predicted answer:", model.config.id2label[idx])