Bắt đầu ngayBắt đầu miễn phí

Áp dụng SMOTE

Trong bài tập này, bạn sẽ cân bằng lại dữ liệu bằng Synthetic Minority Over-sampling Technique (SMOTE). Khác với ROS, SMOTE không tạo các bản sao y hệt quan sát, mà tạo ra các mẫu tổng hợp mới khá giống với các quan sát hiện có trong lớp thiểu số. Vì vậy, SMOTE tinh vi hơn một chút so với việc chỉ sao chép quan sát. Hãy áp dụng SMOTE cho dữ liệu thẻ tín dụng của chúng ta. Bộ dữ liệu df đã sẵn có và các gói cần cho SMOTE cũng đã được nhập. Ở bài tập tiếp theo, bạn sẽ trực quan hóa kết quả và so sánh với dữ liệu gốc để thấy rõ tác động của việc áp dụng SMOTE.

Bài tập này là một phần của khóa học

Phát hiện gian lận với Python

Xem khóa học

Hướng dẫn bài tập

  • Dùng hàm prep_data trên df để tạo đặc trưng X và nhãn y.
  • Định nghĩa phương pháp tái lấy mẫu là SMOTE dạng chuẩn, gán vào biến method.
  • Dùng .fit_resample() trên Xy gốc để thu được dữ liệu đã tái lấy mẫu.
  • Vẽ dữ liệu đã tái lấy mẫu bằng hàm plot_data().

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

from imblearn.over_sampling import SMOTE

# Run the prep_data function
X, y = ____(df)

# Define the resampling method
method = ____()

# Create the resampled feature set
X_resampled, y_resampled = method.____(____, ____)

# Plot the resampled data
plot_data(____, ____)
Chỉnh sửa và Chạy Mã