Görsel-Dil Transformer'ları (ViLT) ile VQA
Çok modlu üretime başlama zamanı! Görsel Soru-Cevaplama (VQA) ile başlayalım. Aşağıdaki görseldeki trafik ışığının rengini belirlemek için dandelin/vilt-b32-finetuned-vqa modelini kullanacaksın:

Önişlemci (processor), model (model) ve görsel (image) senin için yüklendi.
Bu egzersiz, kursun bir parçasıdır
Hugging Face ile Multi-Modal Modeller
Egzersiz talimatları
textistemini veimagegörselini önişle.- Modelden yanıt belirteçlerini üret ve
outputsdeğişkenine ata. - Çıktı logits değerlerini kullanarak en yüksek güvene sahip yanıtın kimliğini (ID) bul.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
text = "What color is the traffic light?"
# Preprocess the text prompt and image
encoding = ____(____, ____, return_tensors="pt")
# Generate the answer tokens
outputs = ____
# Find the ID of the answer with the highest confidence
idx = outputs.logits.____
print("Predicted answer:", model.config.id2label[idx])