ПочатиПочніть безкоштовно

VQA за допомогою Vision Language Transformers (ViLT)

Час попрактикуватися в мультимодальній генерації, почавши з Visual Question-Answering (VQA). Ви використаєте модель dandelin/vilt-b32-finetuned-vqa, щоб визначити колір світлофора на зображенні нижче:

Picture of a traffic light showing red

Препроцесор (processor), модель (model) і зображення (image) уже завантажені для вас.

Ця вправа є частиною курсу

Багатомодальні моделі з Hugging Face

Переглянути курс

Інструкції до вправи

  • Виконайте попередню обробку підказки text і зображення image.
  • Згенеруйте токени відповіді за допомогою моделі та запишіть у outputs.
  • Знайдіть ID відповіді з найвищою впевненістю, використовуючи логіти виходу.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

text = "What color is the traffic light?"

# Preprocess the text prompt and image
encoding = ____(____, ____, return_tensors="pt")

# Generate the answer tokens
outputs = ____

# Find the ID of the answer with the highest confidence
idx = outputs.logits.____
print("Predicted answer:", model.config.id2label[idx])
Редагувати та запускати код