Tiền xử lý ảnh
Trong bài tập này, bạn sẽ dùng bộ dữ liệu flickr (30.000 ảnh kèm chú thích) để thực hiện các bước tiền xử lý cho ảnh. Tiền xử lý giúp dữ liệu ảnh phù hợp để suy luận với các tác vụ mô hình trên Hugging Face, chẳng hạn tạo văn bản từ ảnh. Ở đây, bạn sẽ tạo chú thích văn bản cho ảnh sau:

Bộ dữ liệu (dataset) đã được nạp với cấu trúc sau:
Dataset({
features: ['image', 'caption', 'sentids', 'split', 'img_id', 'filename'],
num_rows: 10
})
Mô hình tạo chú thích ảnh (model) đã được nạp.
Bài tập này là một phần của khóa học
Mô hình đa phương thức với Hugging Face
Hướng dẫn bài tập
- Tải ảnh từ phần tử ở vị trí chỉ mục
5của bộ dữ liệu. - Tải bộ xử lý ảnh (
BlipProcessor) của mô hình đã huấn luyện sẵn:Salesforce/blip-image-captioning-base. - Chạy processor trên
image, nhớ chỉ định cần PyTorch tensors (pt). - Dùng phương thức
.generate()để tạo chú thích bằngmodel.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Load the image from index 5 of the dataset
image = dataset[5]["____"]
# Load the image processor of the pretrained model
processor = ____.____("Salesforce/blip-image-captioning-base")
# Preprocess the image
inputs = ____(images=____, return_tensors="pt")
# Generate a caption using the model
output = ____(**inputs)
print(f'Generated caption: {processor.decode(output[0])}')
print(f'Original caption: {dataset[5]["caption"][0]}')