Zacznij terazZacznij za darmo

VQA z użyciem Vision Language Transformers (ViLTs)

Czas wypróbować generowanie multi-modalne – zaczniemy od wizualnego odpowiadania na pytania (VQA). Użyjesz modelu dandelin/vilt-b32-finetuned-vqa, aby określić kolor światła na poniższym zdjęciu:

Picture of a traffic light showing red

Preprocesor (processor), model (model) i obraz (image) zostały już wczytane.

To ćwiczenie jest częścią kursu

Modele multimodalne z Hugging Face

Zobacz kurs

Instrukcje do ćwiczenia

  • Wstępnie przetwórz prompt tekstowy text oraz obraz image.
  • Wygeneruj tokeny odpowiedzi za pomocą modelu i przypisz wynik do outputs.
  • Znajdź identyfikator odpowiedzi o najwyższym poziomie pewności, korzystając z logitów wyjściowych.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

text = "What color is the traffic light?"

# Preprocess the text prompt and image
encoding = ____(____, ____, return_tensors="pt")

# Generate the answer tokens
outputs = ____

# Find the ID of the answer with the highest confidence
idx = outputs.logits.____
print("Predicted answer:", model.config.id2label[idx])
Edytuj i uruchom kod