Bắt đầu ngayBắt đầu miễn phí

Tiền xử lý ảnh

Trong bài tập này, bạn sẽ dùng bộ dữ liệu flickr (30.000 ảnh kèm chú thích) để thực hiện các bước tiền xử lý cho ảnh. Tiền xử lý giúp dữ liệu ảnh phù hợp để suy luận với các tác vụ mô hình trên Hugging Face, chẳng hạn tạo văn bản từ ảnh. Ở đây, bạn sẽ tạo chú thích văn bản cho ảnh sau:

Photo of 2 people with 1 playing the guitar

Bộ dữ liệu (dataset) đã được nạp với cấu trúc sau:

Dataset({
    features: ['image', 'caption', 'sentids', 'split', 'img_id', 'filename'],
    num_rows: 10
})

Mô hình tạo chú thích ảnh (model) đã được nạp.

Bài tập này là một phần của khóa học

Mô hình đa phương thức với Hugging Face

Xem khóa học

Hướng dẫn bài tập

  • Tải ảnh từ phần tử ở vị trí chỉ mục 5 của bộ dữ liệu.
  • Tải bộ xử lý ảnh (BlipProcessor) của mô hình đã huấn luyện sẵn: Salesforce/blip-image-captioning-base.
  • Chạy processor trên image, nhớ chỉ định cần PyTorch tensors (pt).
  • Dùng phương thức .generate() để tạo chú thích bằng model.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Load the image from index 5 of the dataset
image = dataset[5]["____"]

# Load the image processor of the pretrained model
processor = ____.____("Salesforce/blip-image-captioning-base")

# Preprocess the image
inputs = ____(images=____, return_tensors="pt")

# Generate a caption using the model
output = ____(**inputs)
print(f'Generated caption: {processor.decode(output[0])}')
print(f'Original caption: {dataset[5]["caption"][0]}')
Chỉnh sửa và Chạy Mã