Phân đoạn với Mask R-CNN đã được huấn luyện sẵn
Trong bài tập này, bạn sẽ dùng mô hình Mask R-CNN đã được huấn luyện sẵn để thực hiện instance segmentation trên bức ảnh sau gồm hai con mèo.

Mô hình bạn sẽ dùng đã được huấn luyện trước trên COCO dataset, bộ dữ liệu chứa ảnh các vật thể phổ biến, bao gồm cả động vật. Nhờ vậy, mô hình có thể nhận diện mèo ngay lập tức mà không cần fine-tune.
Nhiệm vụ của bạn là tải mô hình và ảnh hai con mèo, chuẩn bị ảnh, rồi truyền vào mô hình để lấy dự đoán. Image từ PIL, torch, transforms từ torchvision, và maskrcnn_resnet50_fpn đã được nhập sẵn cho bạn.
Bài tập này là một phần của khóa học
Deep Learning cho Ảnh với PyTorch
Hướng dẫn bài tập
- Tải Mask R-CNN
pretrainedvàomodelbằngmaskrcnn_resnet50_fpn(). - Biến đổi ảnh hai con mèo thành tensor và thêm một chiều (unsqueeze).
- Thực hiện suy luận bằng cách truyền ảnh vào mô hình và gán đầu ra cho
prediction.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Load a pre-trained Mask R-CNN model
model = ____(____)
model.eval()
# Load an image and convert to a tensor
image = Image.open("two_cats.jpg")
transform = transforms.Compose([transforms.ToTensor()])
image_tensor = transform(image).____
# Perform inference
with torch.no_grad():
prediction = ____
print(prediction)