VQA z użyciem Vision Language Transformers (ViLTs)
Czas wypróbować generowanie multi-modalne – zaczniemy od wizualnego odpowiadania na pytania (VQA). Użyjesz modelu dandelin/vilt-b32-finetuned-vqa, aby określić kolor światła na poniższym zdjęciu:

Preprocesor (processor), model (model) i obraz (image) zostały już wczytane.
To ćwiczenie jest częścią kursu
Modele multimodalne z Hugging Face
Instrukcje do ćwiczenia
- Wstępnie przetwórz prompt tekstowy
textoraz obrazimage. - Wygeneruj tokeny odpowiedzi za pomocą modelu i przypisz wynik do
outputs. - Znajdź identyfikator odpowiedzi o najwyższym poziomie pewności, korzystając z logitów wyjściowych.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
text = "What color is the traffic light?"
# Preprocess the text prompt and image
encoding = ____(____, ____, return_tensors="pt")
# Generate the answer tokens
outputs = ____
# Find the ID of the answer with the highest confidence
idx = outputs.logits.____
print("Predicted answer:", model.config.id2label[idx])