BaşlayınÜcretsiz başlayın

Görsel-Dil Transformer'ları (ViLT) ile VQA

Çok modlu üretime başlama zamanı! Görsel Soru-Cevaplama (VQA) ile başlayalım. Aşağıdaki görseldeki trafik ışığının rengini belirlemek için dandelin/vilt-b32-finetuned-vqa modelini kullanacaksın:

Picture of a traffic light showing red

Önişlemci (processor), model (model) ve görsel (image) senin için yüklendi.

Bu egzersiz, kursun bir parçasıdır

Hugging Face ile Multi-Modal Modeller

Kursa Göz Atın

Egzersiz talimatları

  • text istemini ve image görselini önişle.
  • Modelden yanıt belirteçlerini üret ve outputs değişkenine ata.
  • Çıktı logits değerlerini kullanarak en yüksek güvene sahip yanıtın kimliğini (ID) bul.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

text = "What color is the traffic light?"

# Preprocess the text prompt and image
encoding = ____(____, ____, return_tensors="pt")

# Generate the answer tokens
outputs = ____

# Find the ID of the answer with the highest confidence
idx = outputs.logits.____
print("Predicted answer:", model.config.id2label[idx])
Kodu Düzenle ve Çalıştır