VQA với Vision Language Transformers (ViLT)
Đến lúc bạn tự tay thử tạo sinh đa phương thức, bắt đầu với Visual Question-Answering (VQA). Bạn sẽ dùng mô hình dandelin/vilt-b32-finetuned-vqa để xác định màu của đèn giao thông trong hình sau:

Bộ tiền xử lý (processor), mô hình (model), và ảnh (image) đã được nạp sẵn cho bạn.
Bài tập này là một phần của khóa học
Mô hình đa phương thức với Hugging Face
Hướng dẫn bài tập
- Tiền xử lý
textprompt vàimage. - Tạo các token câu trả lời từ mô hình và gán vào
outputs. - Tìm ID của câu trả lời có độ tin cậy cao nhất bằng các logits đầu ra.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
text = "What color is the traffic light?"
# Preprocess the text prompt and image
encoding = ____(____, ____, return_tensors="pt")
# Generate the answer tokens
outputs = ____
# Find the ID of the answer with the highest confidence
idx = outputs.logits.____
print("Predicted answer:", model.config.id2label[idx])