VQA за допомогою Vision Language Transformers (ViLT)
Час попрактикуватися в мультимодальній генерації, почавши з Visual Question-Answering (VQA). Ви використаєте модель dandelin/vilt-b32-finetuned-vqa, щоб визначити колір світлофора на зображенні нижче:

Препроцесор (processor), модель (model) і зображення (image) уже завантажені для вас.
Ця вправа є частиною курсу
Багатомодальні моделі з Hugging Face
Інструкції до вправи
- Виконайте попередню обробку підказки
textі зображенняimage. - Згенеруйте токени відповіді за допомогою моделі та запишіть у
outputs. - Знайдіть ID відповіді з найвищою впевненістю, використовуючи логіти виходу.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
text = "What color is the traffic light?"
# Preprocess the text prompt and image
encoding = ____(____, ____, return_tensors="pt")
# Generate the answer tokens
outputs = ____
# Find the ID of the answer with the highest confidence
idx = outputs.logits.____
print("Predicted answer:", model.config.id2label[idx])