Áp dụng SMOTE
Trong bài tập này, bạn sẽ cân bằng lại dữ liệu bằng Synthetic Minority Over-sampling Technique (SMOTE). Khác với ROS, SMOTE không tạo các bản sao y hệt quan sát, mà tạo ra các mẫu tổng hợp mới khá giống với các quan sát hiện có trong lớp thiểu số. Vì vậy, SMOTE tinh vi hơn một chút so với việc chỉ sao chép quan sát. Hãy áp dụng SMOTE cho dữ liệu thẻ tín dụng của chúng ta.
Bộ dữ liệu df đã sẵn có và các gói cần cho SMOTE cũng đã được nhập. Ở bài tập tiếp theo, bạn sẽ trực quan hóa kết quả và so sánh với dữ liệu gốc để thấy rõ tác động của việc áp dụng SMOTE.
Bài tập này là một phần của khóa học
Phát hiện gian lận với Python
Hướng dẫn bài tập
- Dùng hàm
prep_datatrêndfđể tạo đặc trưngXvà nhãny. - Định nghĩa phương pháp tái lấy mẫu là SMOTE dạng chuẩn, gán vào biến
method. - Dùng
.fit_resample()trênXvàygốc để thu được dữ liệu đã tái lấy mẫu. - Vẽ dữ liệu đã tái lấy mẫu bằng hàm
plot_data().
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
from imblearn.over_sampling import SMOTE
# Run the prep_data function
X, y = ____(df)
# Define the resampling method
method = ____()
# Create the resampled feature set
X_resampled, y_resampled = method.____(____, ____)
# Plot the resampled data
plot_data(____, ____)